标签: OpenAI

别问LLM置信度分数

别问LLM置信度分数

Hacker News 社区近期围绕“是否应该直接询问大模型置信度”展开激烈讨论。核心争议在于:模型以文字形式给出的“我是90%确定”这种口头信心,其可靠性远不如内部log-prob(概率对数)计算出的数值,但后者在易用性和实际场景(如医疗表单填答)中又面临严峻的落地挑战。

MCP-Billing

MCP-Billing

一款名为 MCP-Billing 的产品在 ProductHunt 上线,旨在为基于 Model Context Protocol(MCP)的工具和服务提供计费能力。这意味着 MCP 生态从“能用”进入“可商业化”阶段,开发者可以更方便地为自己的 MCP 接口设定价格、管理订阅。

《纽约时报》能否从AI霸主手中拯救新闻业?

《纽约时报》能否从AI霸主手中拯救新闻业?

《纽约时报》出版人A.G. Sulzberger在接受Wired访谈时,系统阐述了该报起诉OpenAI和微软侵犯版权、特朗普政府打压新闻自由、以及AI重塑信息消费方式三重危机,认为新闻业正面临“生存级”挑战。这场法律战不仅是商业纠纷,更可能确立AI训练数据合法使用的边界。

Guardoc Health 使用 Amazon Nova 模型处理临床文档

Guardoc Health 使用 Amazon Nova 模型处理临床文档

医疗AI公司Guardoc Health采用Amazon Nova系列模型处理临床文档,将生成式AI直接嵌入医生工作流,旨在减轻文书负担。这一合作值得关注,因为它将亚马逊自研大模型在医疗垂直场景中落地,并可能推动医疗文档自动化的成本与效率拐点。

22580:从 GPT-2 到 Kimi K3,架构演进详解

22580:从 GPT-2 到 Kimi K3,架构演进详解

2026年发布的Kimi K3,相比2019年的GPT-2,模型规模放大了22,580倍。但这篇文章指出,七年间最核心的变化不是参数堆叠,而是模型架构从传统Transformer逐步演变为更高效的线性注意力机制,标志着大模型技术从“力大砖飞”进入“巧劲驱动”的新阶段。

更多要点和提示请见这篇文字帖子:https://t.co/BgPIKOfA9L

更多要点和提示请见这篇文字帖子:https://t.co/BgPIKOfA9L

OpenAI 开发者体验团队成员 jxnlco 通过 Peter Yang 的访谈,公开了他日常使用 Codex 的工作方法——核心不是写代码,而是让 AI 回顾历史对话、自动提炼新技能与工作流,甚至充当“Slack 和邮件参谋”。这套实操思路为如何在日常工作中真正落地 AI 助手提供了可复用的具体范式。

I asked @jxnlco (DevEx at OpenAI): “What’s the craziest thing Codex did for you?” Here’s his answer: “I was on a bike ride when a coworker asked me to fix a launch video. So I connected remotely from my phone and aske…

I asked @jxnlco (DevEx at OpenAI): “What’s the craziest thing Codex did for you?” Here’s his answer: “I was on a bike ride when a coworker asked me to fix a launch video. So I connected remotely from my phone and aske...

OpenAI 内部开发者体验团队成员 Jason Liu 在骑行途中,通过手机远程让 Codex 自主完成视频编辑、导出、发布到 Slack 并持续迭代版本,最终在家门口拿到了视频定稿。这一操作展示了 AI agent 从“写代码”进化到“自主执行多步骤复杂工作流”的潜力。

Kimi’s paper underlines the importance of the right security boundary for agents to run in. tl:DR: container-level isolation is not enough. In their experiments, agents crashed the underlying machine (via kernel panic…

Kimi's paper underlines the importance of the right security boundary for agents to run in. tl:DR: container-level isolation is not enough. In their experiments, agents crashed the underlying machine (via kernel panic...

Kimi 最新论文通过实验证明,当前 AI Agent 常用的容器隔离存在严重安全缺陷——Agent 能引发内核恐慌(kernel panic)直接摧毁宿主机器。而基于 Firecracker 的微虚拟机(如 Vercel Sandbox)则能有效隔离。这一发现直接冲击 Agent 部署的安全基线。