SGAnalog发布:273个真实流片电路如何测出大模型短板

arXiv 上一项新研究提出 SGAnalog,用 273 个来自 Tiny Tapeout 开源流片的模拟电路设计,测试大模型能否真正从原理图还原网表并完成器件尺寸设计,结果显示最强模型仅达 56.1% 精确同构。

一句话看懂:arXiv 上一项新研究提出 SGAnalog,用 273 个来自 Tiny Tapeout 开源流片的模拟电路设计,测试大模型能否真正从原理图还原网表并完成器件尺寸设计,结果显示最强模型仅达 56.1% 精确同构。

事件核心:发生了什么

2026 年 10 月 7 日,arXiv cs.AI 收录论文 SGAnalog,作者构建了一个端到端模拟集成电路基准。数据来自与 Tiny Tapeout 制造穿梭相关的、人工设计的开源电路,每个源文件都取其提交至穿梭时的修订版本,并在固定容器环境中处理。该集合包含 273 个拓扑结构不同的顶层设计,流水线从同一源文件导出原理图图像和 SPICE 网表,使转录任务有精确的结构参考。基准主要评估两项任务:原理图到网表的转录,以及器件尺寸设计。在 66 个固定转录任务上,七个模型中最强者达到 56.1% 的精确图同构,且七个模型中有六个从小规模到中等规模任务时性能急剧下降。对一个前沿模型,去掉作者标注会降低精确匹配,但总体结构 F1 基本保持,说明标签可能帮助连接关系追踪。在 17 个尺寸设计任务上,领先模型对全部 17 个提案都收敛,并以 91.2 分(满分 100)接近人类参考;而两个最新的 Claude 模型对同样提示分别拒绝 4 个和 11 个,尽管它们在转录任务中并未拒绝。无尺寸的提案得零分。两项任务给出不同的模型排名,显示视觉能力与设计能力并不同步,也暴露了某一模型家族的政策限制而非能力上限。

为什么重要

模拟电路设计长期依赖专家经验和专有工具,公开且可复现的评测基准很少。SGAnalog 的价值在于把评测锚定在真实流片修订版、统一容器环境和作者测试台上,从而能追问两个关键问题:模型是否学到了可迁移的电路技能,而不是记住相似例子;以及输出在指定工艺和测试条件下是否可用。目前公开信息显示,这项研究对 AI 辅助 EDA、大模型多模态理解硬件图纸、以及开源芯片生态都有参考意义。它同时提醒行业,当前最强模型在精确结构还原上仍远未可靠,尺寸设计的排序也和转录排名不一致,单一榜单难以概括模型在硬件任务上的真实水平。

对用户/开发者/创作者的影响

对模拟 IC 工程师和 EDA 开发者,这个基准提供了一套可回溯到具体提交版本的开源测试集,便于在本地比较不同大模型或自研模型的原理图理解能力。对使用大模型辅助电路转录的团队,60% 左右的精确同构意味着一半以上的输出仍需人工核对,不能直接进入流片流程。对模型厂商,尺寸设计中的拒绝行为值得注意:某些安全策略可能在工程提示下触发,影响 API 在专业场景的可用性,需要区分是能力不足还是政策过滤。对创客和 Tiny Tapeout 参与者,自己的公开设计可能被纳入此类基准,提交修订记录和测试台会变得更有价值。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是看 SGAnalog 是否将代码、容器环境和任务划分完全公开,以及能否被社区复现;二是关注后续模型在精确图同构上的提升速度,以及是否出现专门针对网表结构的微调方案;三是观察模型厂商是否调整安全策略,使专业硬件提示下的拒绝率下降。目前信息仅来自论文摘要,尚未核验全文实验,也不代表已有产品落地。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 27874

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注