标签: LLM

Eval bug: on HIP, a sequence whose prompt shares a llama_decode() batch with another sequence’s decode row gets corrupted logits, and every

Eval bug: on HIP, a sequence whose prompt shares a llama_decode() batch with another sequence's decode row gets corrupted logits, and every

在 HIP(ROCm)后端下,当一个新序列的 prompt 行与另一个正在生成序列的 decode 行被放进同一个 llama_decode() batch 时,加入方序列(seq 1)的首个采样 token 就会出错,并退化成 3–7 个 token 的循环,但所有调用仍返回成功。优先确认是否在使

Eval bug: Dense Llama 4 model crashes

Eval bug: Dense Llama 4 model crashes

这个报错发生在将一个稠密(非 MoE)Llama 4 模型从 HuggingFace 转换 GGUF 后尝试加载时,llama.cpp 引擎因模型配置中的专家字段矛盾而崩溃。优先排查转换前的 config.json 中是否残留了不匹配的专家配置字段,删除它们是最快的验证路径。

[RFC]: Partial Cache Hits for Hybrid Models

[RFC]: Partial Cache Hits for Hybrid Models

该 RFC 讨论的是 vLLM 在混合架构模型(Full Attention + Mamba)中,由于 Mamba 状态块大小过大导致前缀缓存命中粒度变粗的问题。优先排查方向并非“修复报错”,而是评估是否引入 hash_block_size 配置以实现部分缓存命中(Partial Cache Hit