Vulkan: vk::DeviceLostError crash in ggml_vk_flash_attn on AMD gfx1102 (RADV PHOENIX)

用户在 llama.cpp 的 llama-server 中使用 Vulkan 后端( --device Vulkan0 )加载 GGUF 模型,并开启 Flash Attention 加速( -fa on )。在首次 decode 阶段(prompt processing 完成后,生成第一个 to

用户在 llama.cpp 的 llama-server 中使用 Vulkan 后端( --device Vulkan0 )加载 GGUF 模型,并开启 Flash Attention 加速( -fa on )。在首次 decode 阶段(prompt processing 完成后,生成第一个 to

OpenAI 正在将 ChatGPT 集成到医疗机构使用的电子病历系统中,让医生能够直接在病历界面调用对话式AI来帮助撰写、查询或整理患者信息。这一动作意味着大模型开始切入医疗数据最核心、合规门槛最高的环节。

用户在 llama.cpp 的 llama-server 中,使用两块 AMD FirePro D700(Tahiti XT,与 HD 7970/R9 280X 同型)显卡,在 Arch Linux 系统中启用全量 GPU 卸载( -ngl 99 )处理 500+ token 上下文时触发崩溃。系统

AI 实验室 Midjourney 收购了拥有约 430 万月活用户的社交占星应用 Co-Star。此举不仅意味着 Midjourney 的产品线从图像/视频生成扩展到消费级社交领域,更可能为其推出独立移动应用铺路。

用户在 Windows 11 24H2 系统上,使用 llama.cpp b10091 版本(CUDA 13.3 构建),配合 NVIDIA GeForce RTX 4060 Laptop 8GB 显卡和 Intel Core Ultra 5 125H CPU,加载 Ornith-1.0-35B-M

Bluesky将其AI助手Attie升级为一个开放社交研究工具,新增“Quests”功能,允许用户无需编程即可查询整个AT Protocol生态中的趋势与信息。此举意在用户增长放缓背景下,通过AI工具探索变现路径,并提升平台的数据可探索性。

OpenAI 在本周密集发布多项基础设施与产品更新,核心是将 GPT-Live 的全双工语音控制功能引入 ChatGPT 桌面应用,支持用户在 Mac 和 Windows 上通过语音连续交互,同时让后台推理模型并行处理编码、邮件和其他本地任务,这标志着 AI 助手从“一问一答”向“后台协同”模式迈出实质一步。

Anthropic 与 Andon Labs 合作推出了 Drone-Bench 基准测试,用于评估 AI 模型自主操控无人机完成室内定位追踪任务的能力。该测试反映了前沿模型在物理世界操控机器人方面的快速进步,同时揭示了此类“双重用途”技术带来的机遇与风险。
![[RFC]: Opt-in Media URL Cache for `MediaConnector`](https://www.chat-gpts.plus/wp-content/uploads/2026/07/37075-315181f6-768x403.jpg)
在使用 vLLM 进行推理时,尤其是 CI 测试环境或生产环境(如 AMD CI 构建、NFS 共享存储、Kubernetes 持久卷), MediaConnector 会为每个包含媒体 URL 的请求重新发起 HTTP 下载,导致:

用户在 NVIDIA GB10(ARM 架构)上运行 vLLM,使用 --convert embed 启动 Qwen3MoE 模型进行嵌入(embedding)推理时触发此错误。用户环境为 nvcr.io/nvidia/vllm:26.01 容器。