[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs
![[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48718-b3db3e4a-768x403.jpg)
用户在 Nvidia Blackwell B300 上使用 vLLM v0.25.0 部署 Qwen3.6-35B-A3B-NVFP4 模型,当并发请求数超过 8 时,生成吞吐量降至 0.0 tokens/s,容器需要重启。旧版镜像 0.19.2rc1.dev134+gfe9c3d6c5 表现正常。
![[Bug]: Qwen3.6 35B-A3B NVFP4 2-3x slower on B300s with v0.25.0 and randomly hangs](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48718-b3db3e4a-768x403.jpg)
用户在 Nvidia Blackwell B300 上使用 vLLM v0.25.0 部署 Qwen3.6-35B-A3B-NVFP4 模型,当并发请求数超过 8 时,生成吞吐量降至 0.0 tokens/s,容器需要重启。旧版镜像 0.19.2rc1.dev134+gfe9c3d6c5 表现正常。

在 A100 (SM80) 显卡上使用 vLLM 的 API 服务( vllm serve 或 vllm.entrypoints.openai.api_server )时,设置了 --kv-cache-dtype turboquant_k8v4 并加载 BF16 模型(如 Qwen/Qwen2.5-

用户在虚拟化 Intel Xeon 6 / Granite Rapids 主机(GCP C4 系列, c4-standard-24-lssd ,Xeon 6985P-C)上运行 Ollama 官方发行版(0.31.1–0.32.1,包括 Docker 和原生 Linux 安装),所有模型在首次推理时

一套名为“多变量微积分课程”的公开课,将大型语言模型(LLM)作为实时答疑和交互式教学的辅助工具集成进入课程页面,为在线高等数学教育提供了一种AI侧辅学的新范式。

初创公司 Academa.ai 发布了一门集成大语言模型的多变量微积分在线课程,其视频内容完全由自研的 Rust 版 Manim 图形引擎生成,并允许学习者通过 LLM 聊天任意位置提问,旨在实现技术课程教学的自动化翻新。
![[Bug]: QA parser for .csv silently corrupts Q&A pairs: csv.reader quote handling + row/line index mismatch splice answers from wrong lines](https://www.chat-gpts.plus/wp-content/uploads/2026/07/16791-27e22f62-768x403.jpg)
用户在 RAGFlow 的 "Q&A chunk method"(问答分块方法)中,使用制表符(TAB)分隔的 .csv 文件进行解析时触发。当文件中包含以双引号(")开头的续行时,会导致内容被错误地拼接到其他问答对中,一些问答对丢失,且系统报告处理成功。该问题在大型 CSV 文件(如案例中的 67

开源软件Ada发布,定位为“自动数据分析师”,能直接从CSV或Excel文件生成交互式仪表盘、异常检测、基线预测和行动建议。其核心创新在于将大语言模型(LLM)限定在可选、透明的辅助层,确保数据分析的可审计与可重复,而非用AI替代完整分析流程。

一款名为 Ada 的 AI 商业智能工具在 Hacker News 上引发关注。不同于市面常见的对话式 AI 分析,它直接以 CSV 和 Excel 文件为操作核心,将大语言模型(LLM)作为分析引擎的一部分,旨在降低数据分析门槛。

用户在 macOS/Metal 环境下,使用 llama-quantize 工具对 DeepSeek-V4(如 deepseek-ai/DeepSeek-V4-Flash-DSpark )的 GGUF 文件进行量化时触发。典型命令为: llama-quantize --allow-requantiz

用户在 llama.cpp 的 llama-server 中使用 DFlash 推测解码( --spec-type draft-dflash )时,通过 --cache-type-k-draft q8_0 或 --cache-type-v-draft q8_0 将草稿模型的 KV 缓存类型设置为量化