微信视觉团队开源通用多模态嵌入模型WeMM-Embedding,日调用量突破十亿量级

腾讯微信视觉团队宣布开源通用多模态嵌入模型 WeMM-Embedding,支持文本与图像输入,提供 2B、4B、9B 三个版本,目前已在微信推荐与搜索场景大规模上线,日调用量超过十亿次。

腾讯微信视觉团队宣布开源通用多模态嵌入模型 WeMM-Embedding,支持文本与图像输入,提供 2B、4B、9B 三个版本,目前已在微信推荐与搜索场景大规模上线,日调用量超过十亿次。

微信正在小范围内测“小微AI社交”功能,允许用户的AI助手“小微”在获得授权后,跨账号直接联系好友的AI助手,完成信息交换与初步协作。这意味着社交平台的竞争正从人际连接,延伸到AI代理之间的自动沟通。

Google 于 9 月 6 日开始在 Android 系统上分阶段推送 Gemini 的新版最小化交互按钮,用户可将占据大屏的 Gemini 覆盖层一键收起为带 Spark 标志的悬浮气泡,在后台继续处理复杂指令。此举意味着移动端 AI 助手正从“全屏打断式对话”转向“轻量并行工具”。

通义开放平台一次性上线超10个金融服务智能体,覆盖证券、基金、期货、保险,用户在通义聊天中直接@或点击入口即可调用专业金融机构的服务。这是AI应用从“通用对话”转向“垂直场景办事”的一个具体信号。

CCTV 财经报道显示,AI 短剧制作价格出现断崖式下降,每分钟报价从 5000 元跌至数百元,逼近成本线。行业竞争重点正在从“能不能做”转向“内容好不好”,同质化产能正在加速出清。

AI创作者“知识猫”推出一套针对MiniMax H3视频模型的反推提示词模板,用GPT辅助解析参考视频,把近期火爆的“地铁换装”类短视频生成门槛大幅降低,单条内容在X平台获近20万次浏览。

开源项目 sanoTTS 展示了把语音合成模型压缩到极致的能力——最小权重仅 337KB,能在约 3 美元的 ESP32-S3 芯片或浏览器本地运行,无需联网或云端算力。它让“设备自己开口说话”从概念变成了可动手尝试的开源方案。

一个名为 meclaw 的开源项目试图用单个 Rust 二进制文件重新定义多智能体系统——把每个智能体变成文件系统里的一个文件夹,附赠独立的 SQLite 数据库和内核级沙箱,并通过 HTTP 接口实现系统热更新,而非传统的代码部署。

微软安全团队发现,攻击者把原本用于 AI 提示词注入的“隐形 Unicode 字符”技巧,用在了垃圾邮件上——通过在“funding”等金融关键词中间插入不可见字符,绕过关键词过滤。但这项逃避手段几乎失效,超过 99% 的邮件仍被拦截。

Vercel 创始人 Guillermo Rauch 在社交平台 X 上直言,AI 从业者正经历职业生涯中最辛苦的阶段,并称当下为“智能革命”。这一看似与“AI 解放时间”矛盾的观察,揭示了行业高速竞争下的真实工作状态。