用 AIPerf 大规模基准测试 LLM 推理

NVIDIA 推出 AIPerf,作为 GenAI-Perf 的官方继任者,用于大规模测试大模型推理性能。它用多进程架构替代单进程方案,避免压测工具自身成为瓶颈,并支持 15 种以上端点类型和真实流量回放。

NVIDIA 推出 AIPerf,作为 GenAI-Perf 的官方继任者,用于大规模测试大模型推理性能。它用多进程架构替代单进程方案,避免压测工具自身成为瓶颈,并支持 15 种以上端点类型和真实流量回放。

TechCrunch 记者在 All In 大会主持世界模型圆桌后发现,包括 Yann LeCun 的 AMI Labs 和 Fei-Fei Li 的 World Labs 在内,这个赛道的主要玩家几乎都不肯透露自己在做什么产品、面向什么市场。这不是低调,而是一种刻意的战略沉默。

《纽约时报》诉 OpenAI 与微软案中最新解封的 92 页法庭文件显示,两家公司内部早就把抓取全网数据训练大模型形容为“人类史上最大规模的劳动窃取”,并预判这会触发伤害整个网络的“末日循环”,却仍然照做。

Anthropic 将把埃森哲旗下 AI 团队 Faculty 的人员请进公司内部,对模型做评估、红队测试和对齐审查,双方计划五年投入至少 10 亿美元。这是 Dario Amodei 提出的“嵌入式第三方评估者”构想的首次落地。

今年春季,美军一次针对中国船只的武装行动在军机已经升空后被紧急叫停,原因是驱动该行动的情报出自一个 AI 聊天机器人的“幻觉”。这起事件把大模型错误如何沿指挥链上行的问题,摆到了军事决策桌面上。

Anthropic 确认在湾区运营一间湿实验室,用自家大模型驱动真实生物实验。这让“AI 治愈疾病”的承诺第一次落到可验证的实验台上,也把它的安全警告与商业扩张放在了同一张桌面上。

《纽约时报》报道特朗普因经济考量淡化 AI 风险、倾向放松监管,同一时间披露的一起 AI 辅助情报误判几乎引发军事冲突,两件事叠加暴露了当前 AI 治理的核心矛盾。

Anthropic 与埃森哲(Accenture)达成合作,由后者旗下的 AI 业务部门 Faculty 派人“嵌入”Anthropic 内部,独立评估其前沿模型的安全与对齐情况。双方计划未来五年各投入至少 10 亿美元。这是前沿大模型公司首次把独立评估者放进自己内部,而不是交给外部机构事后检查。

GitHub 在 2026 年 9 月 18 日为 Copilot 代码审查推出正式版更新,让审查进度可视化、自动解决评论更智能,并在批量采纳建议时自动生成提交信息。这次改动把 AI 代码审查从“一次性给意见”推向“持续跟踪问题状态”的工作流工具。

CNN 报道称,一份由 AI 辅助生成的情报报告错误声称中东某艘中国船只载有核武器部件,一度让美方接近做出军事反应。这起事件把大模型“幻觉”从内容错误升级为潜在的地缘政治风险。