标签: API

多智能体在投研里加人不等于加效果。论文里最好的模型任务成功率只有52%,真正对最终结果有用的动作不到三分之一,剩下大多是重复劳动、信息没对齐或者计划中途丢了。 投研常见的做法是让几个agent分别看财报、新闻、行业数据和估值,再拼成一份报告。一旦角色分不清、共享的假设和中间结论不稳定,就会出现重复挖同一段数据、关键数字互相打架、最后结论对不上的情况,协调本身就把省下的时间吃掉了。 实际更稳的做法是先把单点做扎实,比如数据抽取、交叉校验…

多智能体在投研里加人不等于加效果。论文里最好的模型任务成功率只有52%,真正对最终结果有用的动作不到三分之一,剩下大多是重复劳动、信息没对齐或者计划中途丢了。 投研常见的做法是让几个agent分别看财报、新闻、行业数据和估值,再拼成一份报告。一旦角色分不清、共享的假设和中间结论不稳定,就会出现重复挖同一段数据、关键数字互相打架、最后结论对不上的情况,协调本身就把省下的时间吃掉了。 实际更稳的做法是先把单点做扎实,比如数据抽取、交叉校验…

多智能体系统在投研场景里并不是“加人越多效果越好”,AgentWorld 论文显示最好的模型任务成功率仅 52%,真正推进任务的动作不到三分之一。值得关注的是,协调本身正在吃掉多智能体省下的时间。

开一个新系列,准备把当前 AI 界的一些术语讲一讲,帮一些小白朋友一点点扫盲,扫清学习路上的一些小障碍。 本期先带来最常见的 11 个 AI 术语,全文小白友好,大家放心食用。 https://t.co/EEKi2cJEUN

开一个新系列,准备把当前 AI 界的一些术语讲一讲,帮一些小白朋友一点点扫盲,扫清学习路上的一些小障碍。 本期先带来最常见的 11 个 AI 术语,全文小白友好,大家放心食用。 https://t.co/EEKi2cJEUN

AI 博主 @jinchenma_ai 启动了一个面向新手的术语科普系列,第一期梳理了 11 个高频 AI 名词,从大语言模型、Token、上下文,到 Agent、Skills、工作流和 AI 幻觉。这类内容的价值在于:当工具已经能直接上手用时,术语混乱反而成了普通人真正用起来的主要门槛。

卧槽。。。有点吓人,第一个通过图灵测试的视频模型出现了。。。 刚刚 @tavus 发布了一个叫 Griffin 的新模型,他们直接给它定义了一个新类别:Human Interaction Model,HIM,人类交互模型。 Tavus 找了 54 个美国和欧洲的参与者,让他们和 Griffin 进行 1 分钟视频通话,事先不告诉对面是 AI。 聊完之后,有 26 个人(48%)认为自己刚才是在和真人视频。 而 Tavus 上一代系统…

卧槽。。。有点吓人,第一个通过图灵测试的视频模型出现了。。。 刚刚 @tavus 发布了一个叫 Griffin 的新模型,他们直接给它定义了一个新类别:Human Interaction Model,HIM,人类交互模型。 Tavus 找了 54 个美国和欧洲的参与者,让他们和 Griffin 进行 1 分钟视频通话,事先不告诉对面是 AI。 聊完之后,有 26 个人(48%)认为自己刚才是在和真人视频。 而 Tavus 上一代系统…

Tavus 发布视频交互模型 Griffin,在 54 人盲测的 1 分钟视频通话中,48% 的参与者误以为对面是真人,远高于其上一代系统的 2.4%。它被官方定义为第一个"人类交互模型(HIM)",主打全双工实时音视频交互。

很多人问 agent 怎么学才不浮。我的书柜《AI Agent 全栈实战》就一个标准:每个概念都能跑起来。 8 章 + 59 张手绘卡,从工具调用到多智能体编排,免费看、代码全开源。 agent 不是玩具,是能进工作流的生产力。https://t.co/U7FpwuRFwX

很多人问 agent 怎么学才不浮。我的书柜《AI Agent 全栈实战》就一个标准:每个概念都能跑起来。 8 章 + 59 张手绘卡,从工具调用到多智能体编排,免费看、代码全开源。 agent 不是玩具,是能进工作流的生产力。https://t.co/U7FpwuRFwX

AI 独立开发者 @kaiz_amm 发布了一套免费、代码全开源的《AI Agent 全栈实战》教程,用 8 章内容和 59 张手绘卡覆盖从工具调用到多智能体编排的完整链路,核心标准是"每个概念都能跑起来"。

This great conversation on the rise of AI interpretability with @eric_ho of @GoodfireAI is also available on Spotify, Apple Podcasts, @snipd_app and here on YouTube (like and subscribe!): https://t.co/7TSOLBCvuZ

This great conversation on the rise of AI interpretability with @eric_ho of @GoodfireAI is also available on Spotify, Apple Podcasts, @snipd_app and here on YouTube (like and subscribe!): https://t.co/7TSOLBCvuZ

风投机构 FirstMark 合伙人 Matt Turck 与 AI 可解释性公司 Goodfire 的 Eric Ho 进行了一场关于“AI 可解释性崛起”的对话,相关内容已上线 Spotify、Apple Podcasts、Snipd 和 YouTube。这场讨论之所以值得关注,是因为它把“看懂大模型内部…

Last week, I launched my AI course to help you build a personal AI system that takes work off your plate. 100+ new members have joined since then, and I’m grateful. Instead of making you watch stale videos or sit thro…

Last week, I launched my AI course to help you build a personal AI system that takes work off your plate. 100+ new members have joined since then, and I'm grateful. Instead of making you watch stale videos or sit thro...

AI 创作者 Peter Yang 推出的个人 AI 系统课程上线一周即吸引 100 多名新会员,年费 150 美元并将于 7 天后涨至 200 美元。这反映出 AI 教育正从"追工具、看视频"转向"抄工作流、建系统"。

The future is verification-engineering. Proofs, (e2e) tests, benchmarks, linters… Some tests will be deterministic, some agentic. This looks great. https://t.co/ZSwn1UEupp

The future is verification-engineering. Proofs, (e2e) tests, benchmarks, linters… Some tests will be deterministic, some agentic. This looks great. https://t.co/ZSwn1UEupp

Vercel 首席执行官 Guillermo Rauch 提出"验证工程(verification-engineering)"将成为软件开发的下一阶段,与此同时,一款名为 e2e 的开源智能体测试框架同步亮相,尝试把确定性测试和 Agent 驱动的测试混合在同一个工具链里。