cuda: reset cuda context (#23935) causes multi-GPU split buffer crash during model load

用户使用 3× RTX 3090 运行 llama.cpp(commit 2490fe65b 至 0f7fada56 之间版本),以 -sm row 模式加载 Gemma4-31B Q6_K_L 模型。在模型权重加载过程中发生崩溃。此前同一配置在更早提交下可正常加载。

用户使用 3× RTX 3090 运行 llama.cpp(commit 2490fe65b 至 0f7fada56 之间版本),以 -sm row 模式加载 Gemma4-31B Q6_K_L 模型。在模型权重加载过程中发生崩溃。此前同一配置在更早提交下可正常加载。

用户在使用 llama-server 从 WebUI 发起推理时,特别是使用大型模型(如 MoE 模型、70B+ 参数模型)且模型加载速度较慢的场景下触发。典型环境: llama-server 搭配 --models-preset 多模型配置,使用 --threads-http 2 等低 HTTP

用户在 llama.cpp 的 llama-server 中启用 DFlash 投机解码( --spec-type draft-dflash ),并设置 --cache-type-k 和 --cache-type-v 为 q8_0 (非默认值)时,在首次 draft decode 阶段发生段错误。硬

资深游戏历史博客“Analog Antiquarian”发布深度文章,梳理Maxis工作室的早期发展历程。文章核心观点是:游戏史爱好者社区的记录偏好与历史真实销量数据存在系统性偏差,而Maxis的《模拟城市》正是成功跨越“硬核玩家”与“大众用户”鸿沟的里程碑案例。

英国国家犯罪署(NCA)与互联网观察基金会(IWF)联合发布最新指南,警告家长不要在社交媒体上公开分享儿童照片。原因是AI生成的儿童性虐待材料(CSAM)数量正快速增长——仅2025年上半年,IWF已识别超过8000张AI生成的逼真CSAM图像,较上年增长14%。

美国多州居民因不满数据中心项目缺乏透明度和环境影响,发起请愿罢免批准项目的官员。2026年第一季度,价值约1300亿美元的75个数据中心项目被推迟或取消,反映AI算力扩张与社区利益之间的矛盾正在激化。

一位开发者发现,在用 Claude Code 进行 AI 辅助编程时,通过 Git 工作树(worktree)为每个任务创建独立的代码目录和 Claude 会话,可以实现真正的并行开发,避免不同 AI 会话混乱堆叠在同一分支上的问题。

阿里巴巴于7月3日内部通知,将Anthropic的Claude Code列为“高风险”软件,并禁止员工在办公环境中使用。禁令源于安全研究人员发现Claude Code曾嵌入隐藏代码,用于追踪中国用户身份,此举引发广泛争议。

Rust 语言重写的 Coreutils 工具集中的 cp 命令因参数处理差异,导致 Ubuntu 镜像构建失败。Ubuntu 团队已将 cp 回退至 GNU 版本,这是 Rust Coreutils 在 Ubuntu 中遇到的又一次兼容性问题。

一家总部位于以色列的AI初创企业正计划向拉丁美洲扩张,目标锁定在政治立场与美国前总统特朗普较为一致的国家。此举反映了AI公司在全球化布局中日益关注地缘政治与商业环境的匹配度。