从文本到具身:我给 AI Agent 搭了套实时 3D 交互身体

开发者通过接入魔珐星云具身驱动 SDK,为纯文本 AI Agent 装上了能实时响应的 3D 数字人身体,实现语音、口型、表情和动作的同步输出,端到端延迟控制在 500ms 左右,并支持对话打断。

开发者通过接入魔珐星云具身驱动 SDK,为纯文本 AI Agent 装上了能实时响应的 3D 数字人身体,实现语音、口型、表情和动作的同步输出,端到端延迟控制在 500ms 左右,并支持对话打断。

一款尝试将 CRM、WhatsApp 和自动化工作流整合于一体的 AI 操作系统正在吸引早期用户,强调“不必在多标签页之间来回切换”,并声称能在二十分钟内完成部署。它把 AI 智能体嵌入商业沟通和客户管理流程,而非作为单独的工具存在。

Moonshine AI 发布了一款名为 Moonshine Voice 的开源语音工具包,能在手机、树莓派甚至微控制器上本地运行实时语音转文字、语音合成和对话代理,在流式处理场景下精度超越 OpenAI 的 Whisper Large V3,模型体积却缩小了 6 倍多。

Prefect 团队发布了 FastMCP 项目,这是一个为 AI 应用(LLM)与外部工具、数据之间提供标准化连接能力的开源框架。它已成为 MCP(模型上下文协议)生态中最主流的实现方案,日下载量达百万次,累计支撑了约 70% 的 MCP 服务器。

上海科学智能研究院(上智院)正式发布并开放了科学多模态基础模型“神珍”(MKB),该模型以110亿参数统一处理DNA、RNA、蛋白质、小分子、气象和医学影像六类科学数据,在多项评测中展现了与万亿参数级模型竞争的实力,并同步提供了完整的开源代码、权重及部署文档。

小红书与北大联合开源 UltraEP,它能在每个微批次和每一层动态复制热点专家,将大规模 MoE 模型训练和推理的吞吐提升至理想性能的 94% 以上——解决了此前专家并行中 GPU 负载不均、大量算力被白白浪费的核心痛点。

通义实验室发布新一代语音合成模型 Qwen-Audio-3.0-TTS,包含 Flash(低延迟)和 Plus(高质量)两个版本,在第三方评测中多项指标领先。其最直接的变化是支持 16 种语言、20 种方言,并允许用户用自然语言“指挥”声音的情绪、角色和场景,而非仅靠技术参数调优。

阿里通义千问团队发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS,推出 Flash 和 Plus 两个版本,其中 Plus 版本在 Artificial Analysis 全球语音排行榜 Speech Arena 上排名第一。该模型支持 16 种语言和 20 种中文方言,首包延迟低至 300m…

小米发布了机器人基础模型 Xiaomi-Robotics-1,通过“无实体预训练+少量真机微调”的混合策略,首次在机器人领域验证了类似大语言模型的规模法则——数据与模型参数越大,真实操控的成功率越高。

Zuntria 于今日在 Product Hunt 上线,定位为一款“AI 成功操作系统”,旨在将用户的生活、商业与目标管理自动化整合到一个引擎中。它并非简单的任务管理工具,而是试图以 AI 驱动的结构化系统替代分散的规划和执行流程。