Robbyant 发布 LingBot-VLA 2.0:用于跨实体机器人操作的开源 6B 视觉-语言-动作 (VLA) 模型

Robbyant 发布了 LingBot-VLA 2.0,一个拥有 60 亿参数的开源视觉-语言-动作(VLA)模型,能让不同型号的机器人通过自然语言指令和视觉输入执行复杂操作任务。这一进展将缩小通用 AI 研究与实体机器人部署之间的差距。

Robbyant 发布了 LingBot-VLA 2.0,一个拥有 60 亿参数的开源视觉-语言-动作(VLA)模型,能让不同型号的机器人通过自然语言指令和视觉输入执行复杂操作任务。这一进展将缩小通用 AI 研究与实体机器人部署之间的差距。

SpaceX AI 于本周发布了 Grok 4.5,马斯克声称其性能接近 Anthropic 的 Opus 4.7,但定价仅为后者的十分之一左右;该模型主打更高 token 效率和更低的推理成本,将在次日向公众开放。

国内大模型独角兽阶跃星辰(Step Star)宣布将推出自有AI终端品牌、智能体系统及其首款AI智能体手机。这意味着它成为了第一家将大模型能力实质性落地到终端硬件的全球主要大模型厂商,时机领先于计划2027年推出AI终端产品的OpenAI。

用户在使用 Ollama(版本详情见后)加载模型(如 ollama pull 、 ollama create )时,如果模型文件是恶意构造的 GGUF 格式文件,Ollama 的 GGUF 解码器会因未经验证的字符串长度而崩溃。具体报错为 makeslice: len out of range 或

用户在使用 Ollama 加载模型文件时触发问题,尤其是通过外部来源获取的 GGUF v1 格式模型文件。攻击者可以构造一个仅 24 字节的恶意 GGUF v1 文件,其中包含一个长度为零的字符串字段,导致解码器崩溃。

用户在 ComfyUI 中加载任何检查点(例如来自 black-forest-labs/FLUX.2-small-decoder 的 full_encoder_small_decoder.safetensors )时触发。该检查点不包含可识别的 VAE 权重,导致 ComfyUI 的 VAE 初始化

谷歌在相册应用中推出AI驱动的“视频混音”功能,基于其Gemini Omni模型,用户只需选择素材和音乐,即可在数秒内自动生成具备转场、节奏剪辑和调色的短视频,目标直指零门槛的电影级视频创作。

腾讯混元 Hy3 模型在办公智能代理工具 WorkBuddy 上线后,因用户调用量远超预期导致算力峰值承压,项目团队已紧急完成算力扩容。此次事件反映出市场对国产高性能大模型办公工具的强劲需求,也再次验证了大模型落地中“推理算力”环节的敏感性。

7 月 9 日,蚂蚁集团旗下灵波开源了 LingBot-Video,这是全球首个面向具身智能的开源视频基础模型。它采用 MoE 架构,在机器人任务评测集 RBench 上得分 0.620,超越了多个主流闭源和开源模型,可能改变视频生成模型从“内容创作”到“物理世界理解”的技术方向。

瑞典AI初创公司Lovable正在洽谈新一轮最高3亿美元的融资,若完成,其估值将从去年12月的66亿美元翻倍至132亿美元。这家以“氛围编码(vibe-coding)”技术为核心的公司,仅用不到三年便实现了年化收入5亿美元,反映出AI驱动的低代码开发正在成为最赚钱的应用场景之一。