一句话看懂:TechCrunch 记者在 Synthesia 纽约办公室用自己的照片和两分钟录音,生成了一个可对话的交互式数字分身,并把它训练成只回答自己某篇报道相关问题的“问答机器人”。这标志着 AI 数字人从“念稿视频”迈向了可交互、可被企业定制的智能体形态。
事件核心:发生了什么
数字人公司 Synthesia 今年早些时候估值达到 40 亿美元,去年 ARR 突破 1 亿美元。其企业客户可以用 AI 虚拟人制作培训视频,并已推出 Roleplay Sessions,让员工与能回话、能打分的 AI 虚拟人练习销售话术。今年 9 月,记者受邀前往其纽约新办公室,接受了“自己被做成数字人”的邀请。
制作流程不复杂:在办公室内的小型摄影棚拍摄大量照片、录制两分钟声音,并签署同意书。Synthesia 为其生成了两种产物——个人分身(念给定脚本)和交互式分身(可对话、可倾听),各有戴眼镜和不戴眼镜版本。交互式分身以记者一篇关于风投背景创业公司欺诈率更高的报道为训练素材,只围绕该报道作答,不会回答“我住在纽约哪里”这类私人问题。其技术链路包含语音转文字、语言模型、文字转语音和 Synthesia 自研的视频驱动模型。
为什么重要
此前 AI 数字人主要用于单向视频播报,交互式分身则把数字人、语言模型和检索/约束机制组合成“有边界的智能体”。Synthesia 同时开放了模型选择——客户可选用 Cartesia、ElevenLabs、Google 或 OpenAI 的替代方案,并支持自选云或付费托管。这意味着数字人赛道正从“视频生成工具”向“可交互企业智能体平台”延伸,与 D-ID、HeyGen、Colossyan 的竞争也将从画面质量转向 Agent 能力和生态开放度。
对用户/开发者/创作者的影响
对企业采购者而言,交互式分身可用于培训、客服、内部知识问答等场景,且按业务边界限制回答范围,降低了“乱说话”的合规风险。对开发者,Synthesia 提供 API 平台,可把其视频与语音模型与其他服务组合,构建自定义交互产品,技术栈上多了一条可替换模型的路径。对创作者和记者,个人分身可用于内容分发和受众互动,但需要提前考虑肖像权、声音授权和回答边界——目前公开信息显示,这类分身只能就指定材料作答,不能真正“代表本人”自由表达。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是交互式分身能否从演示走向规模化企业落地,Roleplay Sessions 等产品的实际采用率值得跟踪。二是模型可替换与多云托管是否会成为数字人平台的标配,进而影响定价与议价权。三是监管与平台规则如何界定“以真人形象对话”的 AI 身份披露要求,这可能直接决定此类产品能否在更多市场合规上线。


