大语言模型:下一代 DSL 编写者

InfoQ 刊文提出“类型化领域锚定”(TDG)方法:与其让大模型直接编写团队自定义的外部 DSL,不如把领域逻辑嵌入 Kotlin、TypeScript 等主流语言,让编译器做判定权威,从根本上解决模型“编造语法还理直气壮”的问题。

一句话看懂:InfoQ 刊文提出“类型化领域锚定”(TDG)方法:与其让大模型直接编写团队自定义的外部 DSL,不如把领域逻辑嵌入 Kotlin、TypeScript 等主流语言,让编译器做判定权威,从根本上解决模型“编造语法还理直气壮”的问题。

事件核心:发生了什么

文章指出,大模型的语法能力本质上是训练语料频次的函数。Python、Kotlin、TypeScript、SQL 出现数亿次,生成可靠;一门团队自研的标记语言在语料中出现频次为零,模型只会做“插值推断”——挪用 Mermaid 或 PlantUML 的箭头语法、调用并不存在的 addRelation、给两参结构传三个参数。更麻烦的是 DSL 解析器普遍宽松容错:跳过无法识别的行继续渲染,于是错误不会报错,而是悄悄丢失一条关联关系,最终进入设计文档。

文章给出的方案是 TDG,包含五个构建块:嵌入式而非外部式、按训练数据亲和度选择宿主语言、编译器即判定预言机、生成—编译—修复循环(GCR)、按需教学通道。示例 kUML 用 Kotlin 写 UML/SysML v2/C4 图,模型幻觉出的 aggregation(…) 会被 IntelliJ IDEA 直接标红。文章称,kuml.examples 工具将 SysML v2 图的一次编译通过率从 25% 提升至 87.5%。

为什么重要

它把“大模型代码生成”的可靠性问题从提示词工程拉回软件工程。RAG 锚定的是事实,属于数据空间;TDG 锚定的是语言,属于能力空间,两者正交可组合。对正在把大模型接入内部工具链的团队来说,这意味着不必再自研解析器、高亮、补全和调试器——这些能力随宿主语言工具链开箱即用。文章同时说明,不发明新语法、让编译器检查,也能避免宽松渲染器把幻影引用悄悄补成真实空节点。

对用户/开发者/创作者的影响

开发者若在维护内部 DSL 或配置语言,可优先考虑嵌入式 DSL 路线,用命名参数、枚举、密封类型层次结构让非法构造在类型层面无法表达。API 与平台团队可把“可调用示例查询”实现为 MCP 服务器,返回刚好匹配当前上下文的少量可编译样例,而非塞入完整文档。企业采购侧,评估代码助手时可增加一个维度:目标语言在公开语料中的覆盖度,而不仅是模型榜单分数。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 TDG 在 kUML 之外的实测数据是否会出现,文章中的 Terraform/HCL 部分目前公开信息显示仅为思想实验。二是 GCR 循环的修复次数与失败归因方法是否被更多工程团队验证。三是这套思路能否进入主流代码模型的工具协议,与 MCP 生态形成配合。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 25138

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注