本机速度 vLLM 变压器建模后端

Hugging Face 团队于 2026 年 7 月 8 日宣布,Transformers 库在 vLLM 推理引擎中的建模后端性能已追平甚至超越原生 vLLM 的手写实现。这意味着模型开发者无需为 vLLM 单独编写优化代码,就能直接获得与定制实现相同或更快的推理速度。

Hugging Face 团队于 2026 年 7 月 8 日宣布,Transformers 库在 vLLM 推理引擎中的建模后端性能已追平甚至超越原生 vLLM 的手写实现。这意味着模型开发者无需为 vLLM 单独编写优化代码,就能直接获得与定制实现相同或更快的推理速度。

VetoBench 是一个新的 AI 内存基准测试,它不再测试“是否找对了信息”,而是测试“是否还会提出你之前已经否决掉的东西”。在测试中,没有记忆的代理会重新提出70%-90%已被拒绝的方案,而记录决策痕迹的记忆系统能将这一比例降至0%。

研究人员发现一种名为“HalluSquatting”的新型攻击手段,利用AI编码助手和智能体的“幻觉”特性,通过伪造资源标识符,可在不逐个攻击目标的情况下,大规模组建僵尸网络、发起DDoS攻击。Cursor、GitHub Copilot等9款主流AI工具均被证实存在这一安全缺口。
![[Bug]: v0.26.4 docker up failed for missing files](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16729-23e77327-768x403.jpg)
用户在 Linux 系统(Lubuntu 24.04.4)上,使用 docker compose 启动 RAGFlow v0.26.4 容器时,容器日志中反复出现脚本缺失错误,导致服务无法正常启动。

在运行 RAGFlow v0.26.3 版本,并启用 MCP 服务器( --enable-mcpserver --mcp-mode=host )时,任何 MCP 客户端(如 Claude Code)执行 tools/list 请求,都会导致服务器崩溃,报错 AttributeError: 'str'

用户在使用 RAGFlow v0.26.3(或同期的 nightly 版本)时启用了 MCP Server,通过 streamable-HTTP 协议(路径 /mcp )发送 tools/list 请求。MCP 客户端(如 Cursor)或直接通过 curl 调用时,返回了 JSON-RPC 错误响

美国零售巨头 Target 开发了一套基于大语言模型(LLM)和向量检索的语义匹配系统,用于在营销活动启动前自动匹配最相似的历史案例,替代了此前成本高昂的规则匹配方案,据称在 Top-3 推荐下覆盖率可达 100%。

在 llama.cpp 项目的 HIP CI 流程中,使用 ROCm 工具链编译 ggml-hip 目标时触发问题。用户可能在使用 AMD GPU 进行推理时,通过 Docker 或直接编译的方式运行构建。
![[Bug]: AssertionError at kv_cache_utils.py:1042 — dense draft model + hybrid-attention main (DeltaNet+SWA) fails in unify_kv_cache_spec_page](https://www.chat-gpts.plus/wp-content/uploads/2026/07/43626-9ece450b-768x403.jpg)
用户在使用 vLLM 的推测解码功能(speculative decoding)时,主模型为混合注意力架构(Qwen3-Coder-Next-80B-A3B,包含 DeltaNet 和 SWA),draft 模型为密集注意力架构(LocoOperator-4B)。引擎初始化(engine init)
![[Bug]: Nemotron-3-Super-120B NVFP4 generation degenerates on recent `main` — bisected to #46756](https://www.chat-gpts.plus/wp-content/uploads/2026/07/47241-3ed37331-768x403.jpg)
用户使用 vLLM main 分支推理 nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 模型(NVFP4 量化),在贪婪解码( temperature=0 )下,短文本回答基本正确,但需要多步推理的复杂问题(如 GSM8K)输出崩溃为重复乱码。同一环境中