标签: LLM

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书在OSDI 2026上发表了HELMSMAN系统,用约40台全闪存服务器取代了此前约35000 CPU核心和350TB DRAM的配置,在满足毫秒级延迟的前提下,将向量检索的硬件成本削减了超过90%,同时吞吐能力相比传统方案提升了2-16倍。这一技术路线可能改变大规模在线搜索、推荐系统对昂贵内存的依赖。

RuntimeError: Already borrowed

RuntimeError: Already borrowed

该报错出现在 vLLM 服务化部署 Qwen3.5-122B-A10B-FP8 等大型 MoE 模型时,当大量并发请求(尤其是包含 image_url 内容的多模态请求)通过 /v1/chat/completions 接口发送,导致 EngineCore 进程崩溃。同一并发量下纯文本请求可以稳定运行

GLM 4.7 Flash Crippled Today (6/3/2026)

GLM 4.7 Flash Crippled Today (6/3/2026)

用户在 Ollama 0.30.4 中运行 glm-4.7-flash 模型(Windows/AMD、Linux/Docker/AMD 双环境均复现),用于本地 agent 任务(Hermes agent、OpenCode 开发),出现离谱幻觉与工具调用损坏。同一模型在 0.24.0 下正常。

优质非虚构书籍是AI垃圾内容的对立面

优质非虚构书籍是AI垃圾内容的对立面

在AI生成文本泛滥的当下,HackerNews上的讨论指出,优质非虚构书籍与AI垃圾内容构成了一种对立关系。这不仅关乎内容质量的层次差异,更揭示了一个正在浮现的趋势:当大量AI生成内容使得“AI味”写作变得廉价且千篇一律时,优秀的人工编辑和写作者的价值反而前所未有地凸显。同时,讨论也承认AI作为信息筛选和知识…