标签: LLM

自主攻击的兴起与遏制它们的竞赛

自主攻击的兴起与遏制它们的竞赛

AI 正在把网络攻击从人工操作推向全自动化的“自主攻击”,攻击者甚至能在本地设备上部署小型语言模型绕过监管。2025 年捷豹路虎因网络攻击损失 4.85 亿英镑,说明这类风险已直接冲击企业利润表。

CUDA out of memory

CUDA out of memory

在 vLLM 中,Model Runner V2 作为稠密模型默认执行器时,`profile_cudagraph_memory()` 返回 0,导致 CUDA graph 内存未预留在 KV cache 之外,`capture_model()` 阶段出现 OOM。优先排查方式:确认是否启用了 Mod

[Question]: Chat doesn’t retrieve answer from knowledge

[Question]: Chat doesn't retrieve answer from knowledge

这个问题通常出现在 RAGFlow 中聊天机器人的检索组件未正确关联知识库,或系统提示词缺少 {knowledge} 变量,导致大语言模型(LLM)无法接收知识库内容。优先检查知识库是否已正确关联、嵌入模型是否一致,以及系统提示词是否包含 {knowledge} 变量。

Eval bug: random crashes in cudaStreamSynchronize

Eval bug: random crashes in cudaStreamSynchronize

该报错是 llama.cpp 在 CUDA 后端执行推理时,GPU 因长时间被占用未响应导致驱动看门狗(Watchdog)超时并触发内核态重置(Xid 8),进而引发 cudaStreamSynchronize 同步失败。优先排查 GPU 看门狗超时时间设置及超长上下文推理导致的单次 Kernel