标签: API

AI 音乐生成器 Suno 现在能生成朗读语音了

AI 音乐生成器 Suno 现在能生成朗读语音了

Suno 在原有 AI 音乐生成之外,上线了公开测试版的 Speech 功能,可以按脚本或提示词生成配音,并同时配上一段 AI 背景音乐。它把语音合成和音乐生成塞进同一条音轨,试图在竞争激烈的 TTS 市场之外,找到自己的差异化入口。

⚡ 算力下沉:从“云端军备竞赛”到“端侧具身落地” 大语言模型在云端的高昂推理成本,正在倒逼软硬件协同创新。从轻量化移动端架构,到工业机器人与边缘计算设备,AI 正在加速向物理世界渗透。 技术成熟期的分水岭很明确:谁能用最低的功耗解决实际场景中的具体问题,谁才是下一阶段生态的赢家。 #前沿科技 #人工智能 #具身智能

⚡ 算力下沉:从“云端军备竞赛”到“端侧具身落地” 大语言模型在云端的高昂推理成本,正在倒逼软硬件协同创新。从轻量化移动端架构,到工业机器人与边缘计算设备,AI 正在加速向物理世界渗透。 技术成熟期的分水岭很明确:谁能用最低的功耗解决实际场景中的具体问题,谁才是下一阶段生态的赢家。 #前沿科技 #人工智能 #具身智能

一位 X 用户提出,大模型在云端的高昂推理成本,正把 AI 算力从"军备竞赛"推向端侧与具身场景,下一阶段比的是谁能用最低功耗解决具体问题。

AI Agent 现在几乎可以从整个互联网抓取数据了。 X、YouTube、Reddit、论坛,甚至没有 API 的网站,都能用于研究、分析和监控。 GitHub 上出现了 3 个开源工具: https://t.co/i2lSxG8bLJ

AI Agent 现在几乎可以从整个互联网抓取数据了。 X、YouTube、Reddit、论坛,甚至没有 API 的网站,都能用于研究、分析和监控。 GitHub 上出现了 3 个开源工具: https://t.co/i2lSxG8bLJ

GitHub 上近期出现三个开源工具,让 AI Agent 能统一抓取 X、YouTube、Reddit、GitHub 等平台数据,甚至覆盖没有公开 API 的网站。这补上了 Agent 落地时最缺的一环——稳定的外部数据输入。

AI 正从早期的“大模型文字聊天工具”迅速演变为重塑全球实体经济的工业级基础设施。大模型厂商不再仅仅比拼参数量,而是全面转向工业落地、具身智能(人形机器人)以及 Agent 自动化网络。

AI 正从早期的“大模型文字聊天工具”迅速演变为重塑全球实体经济的工业级基础设施。大模型厂商不再仅仅比拼参数量,而是全面转向工业落地、具身智能(人形机器人)以及 Agent 自动化网络。

科技观察者 @Jack1179655 在 X 上提出,AI 正在从早期的“大模型文字聊天工具”转变为重塑实体经济的工业级基础设施,厂商的竞争焦点已从参数量转向工业落地、具身智能与 Agent 自动化网络。

多智能体在投研里加人不等于加效果。论文里最好的模型任务成功率只有52%,真正对最终结果有用的动作不到三分之一,剩下大多是重复劳动、信息没对齐或者计划中途丢了。 投研常见的做法是让几个agent分别看财报、新闻、行业数据和估值,再拼成一份报告。一旦角色分不清、共享的假设和中间结论不稳定,就会出现重复挖同一段数据、关键数字互相打架、最后结论对不上的情况,协调本身就把省下的时间吃掉了。 实际更稳的做法是先把单点做扎实,比如数据抽取、交叉校验…

多智能体在投研里加人不等于加效果。论文里最好的模型任务成功率只有52%,真正对最终结果有用的动作不到三分之一,剩下大多是重复劳动、信息没对齐或者计划中途丢了。 投研常见的做法是让几个agent分别看财报、新闻、行业数据和估值,再拼成一份报告。一旦角色分不清、共享的假设和中间结论不稳定,就会出现重复挖同一段数据、关键数字互相打架、最后结论对不上的情况,协调本身就把省下的时间吃掉了。 实际更稳的做法是先把单点做扎实,比如数据抽取、交叉校验…

多智能体系统在投研场景里并不是“加人越多效果越好”,AgentWorld 论文显示最好的模型任务成功率仅 52%,真正推进任务的动作不到三分之一。值得关注的是,协调本身正在吃掉多智能体省下的时间。

开一个新系列,准备把当前 AI 界的一些术语讲一讲,帮一些小白朋友一点点扫盲,扫清学习路上的一些小障碍。 本期先带来最常见的 11 个 AI 术语,全文小白友好,大家放心食用。 https://t.co/EEKi2cJEUN

开一个新系列,准备把当前 AI 界的一些术语讲一讲,帮一些小白朋友一点点扫盲,扫清学习路上的一些小障碍。 本期先带来最常见的 11 个 AI 术语,全文小白友好,大家放心食用。 https://t.co/EEKi2cJEUN

AI 博主 @jinchenma_ai 启动了一个面向新手的术语科普系列,第一期梳理了 11 个高频 AI 名词,从大语言模型、Token、上下文,到 Agent、Skills、工作流和 AI 幻觉。这类内容的价值在于:当工具已经能直接上手用时,术语混乱反而成了普通人真正用起来的主要门槛。

卧槽。。。有点吓人,第一个通过图灵测试的视频模型出现了。。。 刚刚 @tavus 发布了一个叫 Griffin 的新模型,他们直接给它定义了一个新类别:Human Interaction Model,HIM,人类交互模型。 Tavus 找了 54 个美国和欧洲的参与者,让他们和 Griffin 进行 1 分钟视频通话,事先不告诉对面是 AI。 聊完之后,有 26 个人(48%)认为自己刚才是在和真人视频。 而 Tavus 上一代系统…

卧槽。。。有点吓人,第一个通过图灵测试的视频模型出现了。。。 刚刚 @tavus 发布了一个叫 Griffin 的新模型,他们直接给它定义了一个新类别:Human Interaction Model,HIM,人类交互模型。 Tavus 找了 54 个美国和欧洲的参与者,让他们和 Griffin 进行 1 分钟视频通话,事先不告诉对面是 AI。 聊完之后,有 26 个人(48%)认为自己刚才是在和真人视频。 而 Tavus 上一代系统…

Tavus 发布视频交互模型 Griffin,在 54 人盲测的 1 分钟视频通话中,48% 的参与者误以为对面是真人,远高于其上一代系统的 2.4%。它被官方定义为第一个"人类交互模型(HIM)",主打全双工实时音视频交互。

很多人问 agent 怎么学才不浮。我的书柜《AI Agent 全栈实战》就一个标准:每个概念都能跑起来。 8 章 + 59 张手绘卡,从工具调用到多智能体编排,免费看、代码全开源。 agent 不是玩具,是能进工作流的生产力。https://t.co/U7FpwuRFwX

很多人问 agent 怎么学才不浮。我的书柜《AI Agent 全栈实战》就一个标准:每个概念都能跑起来。 8 章 + 59 张手绘卡,从工具调用到多智能体编排,免费看、代码全开源。 agent 不是玩具,是能进工作流的生产力。https://t.co/U7FpwuRFwX

AI 独立开发者 @kaiz_amm 发布了一套免费、代码全开源的《AI Agent 全栈实战》教程,用 8 章内容和 59 张手绘卡覆盖从工具调用到多智能体编排的完整链路,核心标准是"每个概念都能跑起来"。