Liquid AI 发布 LFM2.5-VL-3B:一个能读屏、识别物体并在设备端调用工具的 3B 视觉语言模型

Liquid AI 发布了一款名为 LFM2.5-VL-3B 的端侧视觉语言模型,参数量仅 3B,却支持读屏、物体识别和调用设备工具,意味着轻量级多模态模型正在从“能看”走向“能做”。

Liquid AI 发布了一款名为 LFM2.5-VL-3B 的端侧视觉语言模型,参数量仅 3B,却支持读屏、物体识别和调用设备工具,意味着轻量级多模态模型正在从“能看”走向“能做”。

在 ComfyUI 的 Minimax(MiniMax-H3)参考工作流中,使用 comfyui-kitchen attention 相关提交后,低显存设备(如 RTX 4050 6GB)在生成 10 秒视频时出现 OOM。优先排查 attention 实现的内存峰值,可先尝试更新到修复该问题的 c

该报错发生在 Tesla V100(SM70)上以 FP16 精度运行 MiniMax H3 模型时,属于模型结构性的数值溢出问题。优先排查方案是改用 FP32 精度,并建议添加 --disable-dynamic-vram 启动参数以避免第二个独立的 NaN 触发源。

该问题主要出现在 ComfyUI 的“反复运行(重复执行工作流、中途修改提示词后再次运行)”场景,表现为显存占用卡在 23.3/24 GB 附近、GPU 使用率 100% 但采样无法继续或无法停止。优先排查方向是关闭动态显存管理相关参数,并检查系统共享内存(Shared GPU Memory)是否被

OpenAI 将编程代理 Codex 以预览形式集成到 ChatGPT Linux 桌面应用,意味着编码 AI 从命令行工具升级为带项目管理、多代理协作的图形化工作流,但也引发了对本地文件权限控制的新一轮讨论。

DeepSeek 将旗舰模型 V4-Pro 从预览转为正式版本,同时开源了自家 Agent 编排软件 DeepSeek Harness,并宣布新一轮 API 涨价与峰谷计费规则。模型能力提升、生态布局与商业化提速同步发生,值得开发者重新评估成本与选型。

OpenAI 换掉了上任仅九个月的营收负责人,从云安全公司 Wiz 挖来总裁兼首席运营官 Dali Rajic 接任。这是高管连续变动的最新一步,反映 OpenAI 正在把重心压向企业销售与可量化的收入增长,为潜在的上市做准备。

OpenAI 于 2026 年 8 月 13 日发布 GPT‑5.6 Sol 的“超快模式”预览,借助 Cerebras 的算力将输出速度提升至最高每秒 750 token,比标准处理快 14 倍,率先在 OpenAI API 中开放。这是前沿大模型首次在同等智能

Google DeepMind 发布 Gemini 3.7 Flash,距离上一代 3.6 Flash 仅三周,性能全面提升而 API 价格砍半。这是 Google 加速模型迭代、同时用性价比抢占 agent 开发市场的一次直接动作。

Hacker News 上围绕“AI 文本水印”展开的争论表明,水印并非牢不可破,甚至可能被另一种 AI 改写后叠加出更易识别的痕迹;但 Anthropic 等公司仍可能将其作为满足欧盟合规要求的手段推进。