Liquid AI 发布 LFM2.5-VL-3B:一个能读屏、识别物体并在设备端调用工具的 3B 视觉语言模型

Liquid AI 发布了一款名为 LFM2.5-VL-3B 的端侧视觉语言模型,参数量仅 3B,却支持读屏、物体识别和调用设备工具,意味着轻量级多模态模型正在从“能看”走向“能做”。

Liquid AI 发布了一款名为 LFM2.5-VL-3B 的端侧视觉语言模型,参数量仅 3B,却支持读屏、物体识别和调用设备工具,意味着轻量级多模态模型正在从“能看”走向“能做”。

OpenAI 将编程代理 Codex 以预览形式集成到 ChatGPT Linux 桌面应用,意味着编码 AI 从命令行工具升级为带项目管理、多代理协作的图形化工作流,但也引发了对本地文件权限控制的新一轮讨论。

DeepSeek 将旗舰模型 V4-Pro 从预览转为正式版本,同时开源了自家 Agent 编排软件 DeepSeek Harness,并宣布新一轮 API 涨价与峰谷计费规则。模型能力提升、生态布局与商业化提速同步发生,值得开发者重新评估成本与选型。

OpenAI 换掉了上任仅九个月的营收负责人,从云安全公司 Wiz 挖来总裁兼首席运营官 Dali Rajic 接任。这是高管连续变动的最新一步,反映 OpenAI 正在把重心压向企业销售与可量化的收入增长,为潜在的上市做准备。

OpenAI 于 2026 年 8 月 13 日发布 GPT‑5.6 Sol 的“超快模式”预览,借助 Cerebras 的算力将输出速度提升至最高每秒 750 token,比标准处理快 14 倍,率先在 OpenAI API 中开放。这是前沿大模型首次在同等智能

Google DeepMind 发布 Gemini 3.7 Flash,距离上一代 3.6 Flash 仅三周,性能全面提升而 API 价格砍半。这是 Google 加速模型迭代、同时用性价比抢占 agent 开发市场的一次直接动作。

Hacker News 上围绕“AI 文本水印”展开的争论表明,水印并非牢不可破,甚至可能被另一种 AI 改写后叠加出更易识别的痕迹;但 Anthropic 等公司仍可能将其作为满足欧盟合规要求的手段推进。

AI 电影平台 Higgsfield 发布了一部名为 Cully Hill Boys 的 AI 生成电影,并公开展示了制作 Prompt。值得注意的是,影片最出彩的部分并非来自模型本身,而是来自人类编剧、导演以及对外部导演风格的明确调用。

微软宣布将消费者版 Copilot 应用与 Microsoft 365 Copilot 应用合并,同时砍掉一批表现不佳的 AI 功能,8 月 18 日起陆续生效。这说明微软正在从“广撒网式”的 AI 功能堆叠,转向更务实的产品整合,以应对 ChatGPT、Claude 和 Gemini 的竞争。

Meta 正在 WhatsApp 上测试一项名为 Scam Alert 的可选功能,用手机端本地运行的机器学习模型识别疑似诈骗消息并弹出警告。值得关注的不是“AI 反诈”本身,而是 Meta 选择把分类模型完全放在端侧,让消息内容不出设备。