标签: Gemini

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书在OSDI 2026上发表了HELMSMAN系统,用约40台全闪存服务器取代了此前约35000 CPU核心和350TB DRAM的配置,在满足毫秒级延迟的前提下,将向量检索的硬件成本削减了超过90%,同时吞吐能力相比传统方案提升了2-16倍。这一技术路线可能改变大规模在线搜索、推荐系统对昂贵内存的依赖。

Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

初创公司 Cactus 推出了一款名为 Gemma 4 E2B Hybrid 的混合模型,它在小型本地模型内嵌了“置信度探针”,能对每个输出打分,低分时自动将请求转给更大的 Gemini 3.1 Flash-Lite 模型。它仅需将 15–35% 的查询转发即可在多数基准测试中匹敌大模型,显著减少了对云端算力…

Petals:在家运行大语言模型,BitTorrent 风格

Petals:在家运行大语言模型,BitTorrent 风格

Petals 是一个开源项目,允许用户通过 BitTorrent 式的点对点网络,将各自的家用 GPU 贡献出来,联合运行大型语言模型(LLM)和扩散模型,无需依赖集中式云服务。这一项目虽然目前活跃度不高,但其分布式推理的思路仍在探索中,值得关注。

30+ 家企业组团参展 WAIC,张江 AI 小镇藏不住了

30+ 家企业组团参展 WAIC,张江 AI 小镇藏不住了

在刚刚结束的 WAIC 上,张江 AI 小镇内 30 余家本土企业集中展示了从芯片、算法到具身智能的全产业链能力,同时小镇内三家企业(沐曦、华院计算、智谱)在会前一个月接连推进 IPO 或上市进程。这表明,这个仅 2 平方公里的园区,已形成一个从底层算力到上层应用的完整产业闭环,其资本加速与产业出展并举的节奏…