分类: AI 资讯

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书在OSDI 2026上发表了HELMSMAN系统,用约40台全闪存服务器取代了此前约35000 CPU核心和350TB DRAM的配置,在满足毫秒级延迟的前提下,将向量检索的硬件成本削减了超过90%,同时吞吐能力相比传统方案提升了2-16倍。这一技术路线可能改变大规模在线搜索、推荐系统对昂贵内存的依赖。

北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

北京市发布《关于加快智能体引领发展的若干措施》,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿技术概念纳入正式政策文件。这不是一份常规的AI指导意见,而是试图为Agent经济时代搭建基础制度框架,从基础模型能力、底层技术、终端融合到组织形态给出了系统性路径…

RuntimeError: Already borrowed

RuntimeError: Already borrowed

该报错出现在 vLLM 服务化部署 Qwen3.5-122B-A10B-FP8 等大型 MoE 模型时,当大量并发请求(尤其是包含 image_url 内容的多模态请求)通过 /v1/chat/completions 接口发送,导致 EngineCore 进程崩溃。同一并发量下纯文本请求可以稳定运行

Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

初创公司 Cactus 推出了一款名为 Gemma 4 E2B Hybrid 的混合模型,它在小型本地模型内嵌了“置信度探针”,能对每个输出打分,低分时自动将请求转给更大的 Gemini 3.1 Flash-Lite 模型。它仅需将 15–35% 的查询转发即可在多数基准测试中匹敌大模型,显著减少了对云端算力…