标签: LLM

[CI Failure]: [AMD] Nixl PD tests

[CI Failure]: [AMD] Nixl PD tests

用户在 AMD ROCm CI 环境中运行 vLLM 的 Nixl 测试脚本 v1/kv_connector/nixl_integration/tp_config_sweep_accuracy_test.sh 时触发。该测试涉及 KV Cache 在 vLLM 分布式推理中的跨 GPU/节点传输。

Flint:AI时代的可视化语言

Flint:AI时代的可视化语言

微软研究院发布了开源图表生成工具Flint,让AI代理能根据人类可编辑的简洁规范,自动生成高质量图表。它试图用“语义感知”和“跨平台兼容”解决AI输出图表时常见的格式混乱问题,为智能体工作流提供标准化的可视化能力。

Eval bug: CUDA crash on tensor copy

Eval bug: CUDA crash on tensor copy

用户运行 llama-server 进行多卡(2× NVIDIA RTX 5070 Ti)推理,使用 -c 160000 (长上下文)和 -ctk q8_0 -ctv q8_0 (量化缓存),并在升级到 NVIDIA 驱动 590 和 CUDA 13.1 后触发。同时,运行 test-backend

本机速度 vLLM 变压器建模后端

本机速度 vLLM 变压器建模后端

Hugging Face 团队于 2026 年 7 月 8 日宣布,Transformers 库在 vLLM 推理引擎中的建模后端性能已追平甚至超越原生 vLLM 的手写实现。这意味着模型开发者无需为 vLLM 单独编写优化代码,就能直接获得与定制实现相同或更快的推理速度。