企业级 Harness Engineering 实践:运营、数据、Coding 与办公智能体工程化落地|AICon深圳

2026年AICon深圳大会将聚焦从模型能力到智能系统的工程化落地,去哪儿网技术负责人李佳奇将分享企业级Agent工程化实践,揭示当前AI落地的核心瓶颈已从模型能力转向“Harness工程”——即如何让Agent安全、可控、可观测地连接真实业务系统。

2026年AICon深圳大会将聚焦从模型能力到智能系统的工程化落地,去哪儿网技术负责人李佳奇将分享企业级Agent工程化实践,揭示当前AI落地的核心瓶颈已从模型能力转向“Harness工程”——即如何让Agent安全、可控、可观测地连接真实业务系统。

OpenAI 的代码生成工具 Codex 被开发者 Peter Yang 在实战中用于“应对一场战斗”——虽然是自嘲式表达,但再次印证了 AI 编程助手正在从辅助写代码升级为更主动的任务执行者,尤其是在复杂对抗场景下的潜力值得关注。

DeepSeek官方版V4模型的测试视频和真机演示近日在社交平台流出,多方消息显示该模型最快将于下周一(7月中旬首个周一)正式发布。测试数据显示,V4在多项核心指标上已达到Claude Opus 4.8水平,特别是在3D生成能力上表现突出,且成本优势显著。

特斯拉CEO埃隆·马斯克透露,其公司xAI正在训练一个参数规模达2万亿的大模型,预计下周完成初始训练,并声称其综合性能将超越此前版本,可能直接对标月之暗面近期开源的2.8万亿参数模型Kimi K3。

Epoch AI最新测试显示,即使使用简单的提示词让AI模仿人类写作风格,GPTZero、Originality.ai和Turnitin三大主流AI文本检测器对生成内容的漏检率最高接近30%,暴露了当前AI检测工具在面对风格化改写时的脆弱性。

中国监管部门近期明确禁止AI情感陪伴类大模型应用,将“AI虚拟伴侣”定性为可能引发成瘾风险并影响生育率的产品,相关开发者面临合规调整或下架压力。

由李博杰撰写的《深入理解 AI Agent:设计原理与工程实践》一书已全本开源,包含中英双语正文和十章配套实验代码。这本书以“Agent = LLM + 上下文 + 工具”为核心公式,系统性地拆解了 Agent 从工程部署到自我进化的全链路建设方法。

一项来自法国和意大利三所大学的研究显示,当人们依赖AI建议时,回答准确性从27%降至9%,但自信水平却从30%升至76%。AI并未提升判断力,反而抑制了人们“承认不知道”的本能。

OpenAI 悄然将 Codex 模型的可用上下文大小从 372k 缩减到 272k,用户发现早期频繁出现的“模型上下文大小超限”错误已不再出现。随着上下文缩减,OpenAI 开始采用类似加密子代理日志的方式隐藏会话细节,引发部分高级用户对透明度和可控性的担忧。

ChatPlayground AI 推出 Unlimited Plan 终身订阅,限时售价 59.97 美元(原价 619 美元),用户可在单一界面内对比和调用 GPT-4o、Claude Sonnet、Gemini、DeepSeek、Llama、Perplexity 等 20 余个大语言模型,不再需要在多个…