标签: LLM

Eval bug: Speculative Decoding intermittent timeout

Eval bug: Speculative Decoding intermittent timeout

用户在 llama.cpp 的 llama-server 中启用 Vulkan 后端,配合 AMD 显卡运行 Qwen3.6-35B-A3B-UD 模型,并设置了推测解码参数(包括 MTP 和 ngram-mod 模式)。问题通过 llama-swap 调用时被观察到,表现为流式输出突然暂停、连接持

UIUC人工智能助教

UIUC人工智能助教

美国伊利诺伊大学厄巴纳-香槟分校(UIUC)开发了一套名为“AI教学助手”的开源系统,能够在电气工程课程中,并行运行11个模型完成文本、图像检索、生成、审核和排序,实现2秒内回复。这套系统旨在通过检索增强生成(RAG)和基于人类反馈的强化学习(RLHF),为学生提供高质量的多媒体问答服务,但受到教材版权和数据…