别问LLM置信度分数

Hacker News 社区近期围绕“是否应该直接询问大模型置信度”展开激烈讨论。核心争议在于:模型以文字形式给出的“我是90%确定”这种口头信心,其可靠性远不如内部log-prob(概率对数)计算出的数值,但后者在易用性和实际场景(如医疗表单填答)中又面临严峻的落地挑战。

Hacker News 社区近期围绕“是否应该直接询问大模型置信度”展开激烈讨论。核心争议在于:模型以文字形式给出的“我是90%确定”这种口头信心,其可靠性远不如内部log-prob(概率对数)计算出的数值,但后者在易用性和实际场景(如医疗表单填答)中又面临严峻的落地挑战。

一款名为 MCP-Billing 的产品在 ProductHunt 上线,旨在为基于 Model Context Protocol(MCP)的工具和服务提供计费能力。这意味着 MCP 生态从“能用”进入“可商业化”阶段,开发者可以更方便地为自己的 MCP 接口设定价格、管理订阅。

OpenAI和Anthropic即将上市,预计将批量制造数百位亿万富翁。全球数十家非营利组织已开始积极布局,准备争夺这笔可能成为近几十年来最大规模的慈善捐款浪潮。

《纽约时报》出版人A.G. Sulzberger在接受Wired访谈时,系统阐述了该报起诉OpenAI和微软侵犯版权、特朗普政府打压新闻自由、以及AI重塑信息消费方式三重危机,认为新闻业正面临“生存级”挑战。这场法律战不仅是商业纠纷,更可能确立AI训练数据合法使用的边界。

医疗AI公司Guardoc Health采用Amazon Nova系列模型处理临床文档,将生成式AI直接嵌入医生工作流,旨在减轻文书负担。这一合作值得关注,因为它将亚马逊自研大模型在医疗垂直场景中落地,并可能推动医疗文档自动化的成本与效率拐点。

Anthropic 首席执行官 Dario Amodei 再次强调,具备危险能力的开放权重模型可能带来严重风险,但他明确表示公司从未主张全面禁止开放权重模型。他呼吁加强芯片出口管制和强制安全测试,这一立场在业界引发对 AI 安全与开源路线冲突的持续讨论。

2026年发布的Kimi K3,相比2019年的GPT-2,模型规模放大了22,580倍。但这篇文章指出,七年间最核心的变化不是参数堆叠,而是模型架构从传统Transformer逐步演变为更高效的线性注意力机制,标志着大模型技术从“力大砖飞”进入“巧劲驱动”的新阶段。

OpenAI 开发者体验团队成员 jxnlco 通过 Peter Yang 的访谈,公开了他日常使用 Codex 的工作方法——核心不是写代码,而是让 AI 回顾历史对话、自动提炼新技能与工作流,甚至充当“Slack 和邮件参谋”。这套实操思路为如何在日常工作中真正落地 AI 助手提供了可复用的具体范式。

OpenAI 内部开发者体验团队成员 Jason Liu 在骑行途中,通过手机远程让 Codex 自主完成视频编辑、导出、发布到 Slack 并持续迭代版本,最终在家门口拿到了视频定稿。这一操作展示了 AI agent 从“写代码”进化到“自主执行多步骤复杂工作流”的潜力。

Kimi 最新论文通过实验证明,当前 AI Agent 常用的容器隔离存在严重安全缺陷——Agent 能引发内核恐慌(kernel panic)直接摧毁宿主机器。而基于 Firecracker 的微虚拟机(如 Vercel Sandbox)则能有效隔离。这一发现直接冲击 Agent 部署的安全基线。