llama.cpp is slow on GPU

报错“llama.cpp is slow on GPU”通常发生在用户误将 -t 参数设置为 GPU 核心数而非 CPU 线程数,或未通过 --n-gpu-layers 将模型层正确卸载到 GPU。优先排查 -t 和 --n-gpu-layers 参数是否合理。

报错“llama.cpp is slow on GPU”通常发生在用户误将 -t 参数设置为 GPU 核心数而非 CPU 线程数,或未通过 --n-gpu-layers 将模型层正确卸载到 GPU。优先排查 -t 和 --n-gpu-layers 参数是否合理。

MTP 推测解码时,草稿接受率在特定 --ctx-size (如 12032、17024 等)下骤降至近零,导致吞吐量低于无 MTP 基线。该问题呈现约 2048 token 的周期性,优先排查 GPU 电压稳定性或调整 --ctx-size 避开故障区间。

在 macOS Metal 环境下,如果只加载模型、从未运行过任何 prompt 就直接调用 llama_model_free ,会导致 Metal 的 wired memory(线框内存)不释放,系统内存压力居高不下。优先排查是否在释放模型前执行过任何 GPU 操作(包括无关的 dummy 任务)

GCC(GNU编译器套件)指导委员会正式采用一项AI贡献政策,禁止接受任何“法律上重要的”由大语言模型(LLM)生成或衍生而来的代码与文本,但允许维护者酌情接受LLM生成的测试用例。这是开源工具链项目在版权与原创性争议中对AI辅助编程的明确回应。

OpenJDK 社区通过一项临时性政策,禁止贡献中包含由大语言模型(LLM)生成的代码(即使是部分内容),理由是 AI 输出的不可控性可能引入安全隐患,且“提示词”正成为实质源码,接受 AI 代码如同接受未知来源的二进制。这可能是首个主流开源项目对 AI 辅助编程做出系统性限制。

AI合规初创公司Dili完成2170万美元融资(种子轮+Series A),定位为美国基础设施建设中的“合规裁判”,用AI解析复杂建筑法规,目前已在约700个项目落地。这笔融资折射出AI从通用场景转向垂直刚需的趋势。

Expedia Group 推出 AI 辅助可观测性平台 STAR,放弃自主 AI Agent,改用确定性工作流将 LLM 与运维指标结合,在控制风险的前提下将故障排查时间压缩至分钟级。

Compile bug: cuda build warning — 该警告出现在使用 GCC 11.2 等旧版本编译器编译 llama.cpp 并启用 CUDA 后端时,可能是编译器对 std::vector::insert 主机端代码的误报。优先排查编译器版本,升级至 GCC 12+ 即可消除。

该报错发生在 vLLM CPU 测试环境中,由于部分融合算子(`rms_norm_static_fp8_quant` 等)只在 CUDA 或 ROCm 下注册,而 CPU 导入路径缺乏防护(未使用 `hasattr` 或 `try/except`),导致 `AttributeError`。优先排查是

HackerNews上一场热议揭露:AI行业将LLM包装成“智能”可能是一场营销循环交易——类似15年前的“云计算”命名策略,掩盖了真实技术进展与智慧本质的差距,引发对商业泡沫和公众认知的反思。