标签: DeepSeek

把LLM输出拟人化很蠢

把LLM输出拟人化很蠢

一篇在 Hacker News 引发讨论的技术博客提出,给 LLM 添加“拟人化”输出指令(例如“我有 ADHD”“使用简化技术英语”)看似贴心,实则等于在任务执行中途做有损压缩;更合理的做法,是让 Agent 之间保持高保真的机器可读状态,只在人类消费的边界做风格转换。

OpenAI releases GPT-5.6-Cyber, a more cyber-permissive version of GPT-5.6 Sol, to some partners and expands its Daybreak cybersecurity initiative (Sam Sabin/Axios)

OpenAI releases GPT-5.6-Cyber, a more cyber-permissive version of GPT-5.6 Sol, to some partners and expands its Daybreak cybersecurity initiative (Sam Sabin/Axios)

OpenAI 于 2026 年 8 月 10 日向部分合作伙伴提供了 GPT-5.6-Cyber——一个相比通用旗舰 GPT-5.6 Sol 在网络攻防场景中“限制更宽松”的版本,同时扩大了 Daybreak 网络安全计划。值得关注的是,OpenAI 正在把大模型能力更直接地嵌入安全工具链,而并非停留在发布一…

深入了解 Claude 的数学能力

深入了解 Claude 的数学能力

Anthropic 一个未发布的研究版 Claude 在尝试证明黎曼假设时失败,却意外将黎曼 zeta 函数满足该假设的零点占比下界从 41.6% 提升到 67.2%,并给出了形式化可验证的证明。这是 AI 在开放数学问题上首次做出可验证的实质性贡献。

Transformer统治AI 7年,初创公司已开始颠覆它!效率、成本、推理成新战场,下一代LLM架构呼之欲出 https://t.co/LGN3y3Rqrz #大语言模型 #AI架构 #Transformer

Transformer统治AI 7年,初创公司已开始颠覆它!效率、成本、推理成新战场,下一代LLM架构呼之欲出 https://t.co/LGN3y3Rqrz #大语言模型 #AI架构 #Transformer

Transformer 架构主导大语言模型已有七年,一批初创公司正尝试用更高效的替代架构挑战其统治地位,焦点集中在训练效率、推理成本和长文本处理能力上。这场架构层面的竞争,可能比模型参数竞赛更值得关注。

刚刚,Meta开源了一个30B本地端侧Agent模型:Muse Glimmer,能看屏幕、调工具、失败了会自己重试 从Muse Spark专门针对Agent能力蒸馏出来的,在单张消费级GPU(Mac/ PC)上能跑,无需联网 与同尺寸级的Gemma4-31B、Qwen3.6-27B对比,在智能体、编程、多模态、安全和推理等多个基准上表现强劲 多模态输入(文本+图像),能理解屏幕截图、图表、文档,支持OpenClaw等、100+语言 支…

刚刚,Meta开源了一个30B本地端侧Agent模型:Muse Glimmer,能看屏幕、调工具、失败了会自己重试 从Muse Spark专门针对Agent能力蒸馏出来的,在单张消费级GPU(Mac/ PC)上能跑,无需联网 与同尺寸级的Gemma4-31B、Qwen3.6-27B对比,在智能体、编程、多模态、安全和推理等多个基准上表现强劲 多模态输入(文本+图像),能理解屏幕截图、图表、文档,支持OpenClaw等、100+语言 支…

Meta 开源了一个面向本地端侧 Agent 场景的 30B 参数模型 Muse Glimmer,能在单张消费级 GPU 上离线运行,并宣称在智能体、编程、多模态等多个维度上对标甚至超过同尺寸竞品。这是开源社区在"本地化 Agent 推理"方向上的又一次重量级补给。

很多人觉得学AI很难。 其实不然。 我找了14个免费指南, 省得你自己去搜: 1. OpenAI Academy – https://t.co/Twuvb5HoQ5 ChatGPT和OpenAI的官方学院。 2. Coursera – https://t.co/tVAPDjXh8V 跟Andrew Ng学机器学习。 3. Learn Prompting – https://t.co/E2Y5aqUCSx 提示词工程的分步指南。 4.…

很多人觉得学AI很难。 其实不然。 我找了14个免费指南, 省得你自己去搜: 1. OpenAI Academy - https://t.co/Twuvb5HoQ5 ChatGPT和OpenAI的官方学院。 2. Coursera - https://t.co/tVAPDjXh8V 跟Andrew Ng学机器学习。 3. Learn Prompting - https://t.co/E2Y5aqUCSx 提示词工程的分步指南。 4.…

推特博主 @NextBullReady 整理了一份包含14个免费AI学习资源的清单,覆盖官方课程、提示词工程、视频生成、AI绘画、论文写作等方向,为初学者和有进阶需求的创作者提供了一条低成本入门路径。

图灵奖得主 Pearl 说:大模型离 AGI,差的是因果。 他认为 LLM 生成「看似因果」的回答,多来自训练数据里的人类知识,而非真理解因果;主张把语言模型与因果模型结合,支持干预推理和反事实。 这话戳中 scaling 路线的天花板——模型能背因果结论,但不会「如果…会怎样」的推演。要往 agent/决策走,因果建模不是可选项,只是「结合」怎么做还没跑通。

图灵奖得主 Pearl 说:大模型离 AGI,差的是因果。 他认为 LLM 生成「看似因果」的回答,多来自训练数据里的人类知识,而非真理解因果;主张把语言模型与因果模型结合,支持干预推理和反事实。 这话戳中 scaling 路线的天花板——模型能背因果结论,但不会「如果…会怎样」的推演。要往 agent/决策走,因果建模不是可选项,只是「结合」怎么做还没跑通。

图灵奖得主 Judea Pearl 公开表示,大模型离 AGI 的关键差距在于因果推理——模型能复述训练数据里的因果结论,却无法真正进行「如果…会怎样」的反事实推演,这一判断直指当前 scaling 路线的能力天花板。

Meta 发布的 30B 开源模型 Muse Glimmer 打响了端侧 Agent 的第一枪!🔥 由 Unsloth AI 推出的 2-bit GGUF 量化版本,仅需 14GB RAM 即可流畅运行(轻薄本如 MacBook Air 也无压力): ✅ 支持 Vision 多模态 + 顶级 Agent 能力 ✅ 连续 5 分钟无间断自动代码 Bug 排查 ✅ 独立完成 100+ 次工具调用、漏洞复现、代码修复、编写测试及 PR 文档…

Meta 发布的 30B 开源模型 Muse Glimmer 打响了端侧 Agent 的第一枪!🔥 由 Unsloth AI 推出的 2-bit GGUF 量化版本,仅需 14GB RAM 即可流畅运行(轻薄本如 MacBook Air 也无压力): ✅ 支持 Vision 多模态 + 顶级 Agent 能力 ✅ 连续 5 分钟无间断自动代码 Bug 排查 ✅ 独立完成 100+ 次工具调用、漏洞复现、代码修复、编写测试及 PR 文档…

Meta 开源的 30B 参数多模态模型 Muse Glimmer,被 Unsloth AI 压缩到 2-bit GGUF 量化版本后,只需 14GB 内存就能在轻薄本上运行,并完成了连续 5 分钟、100+ 次工具调用的自主代码排错任务,这意味着端侧 Agent 的门槛正在被拉低。