Thinking Machines推出首个开源大模型Inkling,主打定制化对抗“一刀切”AI

由前OpenAI CTO Mira Murati创立的AI初创公司Thinking Machines Lab,于2026年7月15日发布了其首个自研开源大模型Inkling。该模型采用混合专家(MoE)架构、总参数量9750亿但每次任务仅激活约410亿参数,并允许用户根据业务需求调整“思考强度”,目标是挑战巨…

由前OpenAI CTO Mira Murati创立的AI初创公司Thinking Machines Lab,于2026年7月15日发布了其首个自研开源大模型Inkling。该模型采用混合专家(MoE)架构、总参数量9750亿但每次任务仅激活约410亿参数,并允许用户根据业务需求调整“思考强度”,目标是挑战巨…

Suno将其AI歌曲生成能力直接嵌入iPhone的iMessage应用,用户无需切换App即可在聊天界面中通过文字或语音生成并分享歌曲。这一动作将AI音乐创作的门槛从专业工具拉低至日常对话级别,而Suno当前每日已生成超过700万首歌曲。

OpenAI 与键盘设计公司 Work Louder 合作,推出售价 230 美元的专用键盘 Codex Micro,专为其 AI 代码助手 Codex 设计。这是 OpenAI 首次踏足自有品牌硬件领域,也标志着公司将 AI 代理的管理从屏幕交互拓展到物理设备层面。

OpenAI 发布了一款名为 GPT-Red 的自动化红队测试模型,通过自我对抗训练,将大模型对直接提示注入攻击的失败率降至 0.05%,并在真实场景中(如控制自动售货机)成功模拟了恶意操作。这标志着 AI 安全正从“人工防御”向“自动对抗”演进。

用户在 Docker 环境下运行 Open WebUI 0.10.2 版本,后端模型通过 Ollama 服务(或其他 LLM 后端)提供流式推理能力。用户在前端发起对话请求,模型开始流式输出 token,用户点击“停止”按钮期望中断生成,但实际流式传输无法停止,生成持续到模型主动完成。该问题仅在系统

使用 transformers v5 的 AutoTokenizer.from_pretrained() 加载任何 tokenizer_config.json 中设置了 "tokenizer_class": "LlamaTokenizerFast" 或 "LlamaTokenizer" 的模型。已确

用户在 Apple M4 Max(64 GB 统一内存)macOS 系统上,使用 Ollama v0.30.8 运行 MLX 模型 qwen3.6:35b-mlx (上下文窗口 262144)。通过 bench.py 脚本按递增 prompt 长度(1024, 4096, 8192, 16384,

用户在 Windows 终端运行 ollama run mistral:7b --verbose 时,首次请求 GPU 使用率短暂上升(25%)但后续请求 GPU 使用率降至 0-1%,模型响应极慢。其他模型(如 tinyllama)可正常使用 GPU。该问题在 Ollama v0.1.29 及后续

用户在一台仅配备 AMD iGPU(Radeon 890M,RDNA 3.5 架构)的 Linux 设备上运行 Ollama(版本 0.5.11),并与 llama.cpp 的 CPU、ROCm 后端进行性能对比。测试发现 Ollama 推理速度显著慢于 llama.cpp 的 ROCm 后端,甚至

一篇深度分析指出,当前 AI 热潮本质上是围绕 OpenAI 的“泡沫”,而该公司的潜在崩塌可能成为行业“雷曼时刻”。文章披露 OpenAI 计划到 2030 年烧掉超过 8520 亿美元,今年的算力支出预计占全球 AI 算力总支出的 50% 以上。