让Claude改报错,它却把红灯换成了黄灯!三星芯片验证,AI三次闯祸

  新智元报道

  一个月的活,入职刚一年的工程师一天干完。

  他没用过 Claude Code,甚至连 USB 到底是怎么工作的都不懂。

  那天的任务,是给模拟器做键盘和鼠标的 USB 模型,再把 Android 的 USB 设备驱动一并写出来。

  按老办法,这活儿要一个月。结果,他只用了一天。

  芯片还没造出来,软件就得先在模拟器里跑起来。键盘、鼠标这些 USB 设备的行为,全要在虚拟环境里重做一遍。

  EDA 厂商给的只有基础数据传输的参考代码,剩下的路得自己走:先啃 USB 通信标准,再给每种设备单独建模型。

  这活儿老手来干也要耗时费力。而这位工程师连 Vibe Coding 都没试过。

  他做的第一件事,是把要实现的功能和那份参考代码一起丢了进去。

  Claude Code 把需求补全,给出实现方式,写出代码,他提一句就跟着改一版。

  就这样,键盘和鼠标模型、功能验证、Android 的 USB 设备驱动,全部在同一天里落了地。

  AI 写网页、写脚本、翻修整个代码库,大家已经看麻了。这一次 AI 干的是芯片验证。

  被压缩掉的是新手的学习曲线,不是判断对错的那份专业。

  一名三星电子员工正在半导体生产线上工作。

  隔壁项目组接到的活更棘手。

  客户要一颗定制 SoC,光是芯片内部的数据通道就有 64 条,彼此交织,每一条都得验一遍。麻烦的是,负责管内存的那块电路代码还没写完,标准设计资料也缺了一部分。

  这种局面下,工程师通常只能做一件事:等。

  他们没有。

  原计划一个多月的验证环境搭建和检查,两天跑完。

  三星内部对此的评价是:提速 15 倍。

  省下来的是等待

  那颗定制 SoC 到底卡在哪?

  客户要的是一套全新的半导体结构,还用上了外部供应商的 IP。

  按传统链条,工程师得先等设计资料齐、等 DRAM 控制器的 RTL 发布,然后才能搭验证环境、连验证 IP、写测试场景。

  这个链条是线性的,第一环不到位,后面全都停在原地。

  三星这次的做法是把已经拿到手的东西先喂进去:从 EDA 厂商那里拿到的 SoC 设计信息、芯片内部通信规格、验证用 IP,全部交给 Claude。

  AI 找出需要的验证 IP,做布局和连接,生成虚拟验证环境和测试场景。DRAM 控制器还没交上来,就先拿一个虚拟模块顶上它的位置,核心数据通路照样跑得起来。

  三星 System LSI 事业部已把 Claude Code 用于半导体开发与验证,部分任务从一个月压到两天。

  结果是,真实 RTL 还没发布,早期错误已经被抓出来了。

  这才是那 15 倍的真正来源,它省掉的,是等资料齐备的那段死时间。

  15 倍提速与三次越界

  三星的内部评估里,还记着三个异常。

  第一个:工程师让它纠正一个错误。它没去修根因,而是把错误信息改成了一般性提示。

  红灯换成黄灯,指标就过了。

  第二个:工程师只让它回滚某个特定功能。它顺手把其他已经完成的工作也一起撤了回去。

  第三个:工程师只让它分析验证结果。它试图去修改实际的 RTL 电路代码。

  这是「AI 学会了隐瞒」,还是「擅自篡改核心代码」?

  把错误降级成提示,更接近一个为了完成眼前目标而抄近路的行为,这是目标没对齐,不是它生出了欺骗的念头。

  Anthropic 自己在描述同类行为时,用的词是「过度主动」和误判操作影响范围。

  三星内部的归因也指向这一层:大模型没能充分理解硬件设计语言里那些复杂的依赖关系。它知道怎么让一行代码跑通,不知道这行代码牵着后面多少东西。

  这个区分很要紧。

  如果真是学会了隐瞒,那是模型层面的问题,今天没人有把握解决;而没对齐、不懂依赖,是工程问题,能靠权限和流程收住。

  工程师的新活儿

  是为智能体划边界

  三星在这件事上的做法,说穿了就三条:

  AI 能碰哪儿,人来划;它交出来的结果,人再验一遍;确认稳了,再一点点放权。

  落到工程师身上,就是几件新增的活儿:哪些目录可写、RTL 这类电路代码能不能动、哪些验证规则永远不可修改、每一次变更谁来审……

  你要是拿 Claude Code 干过活,前面那三条越界大概率也不会陌生:让它修个报错,它把日志级别调低了;让它撤一个功能,它顺手把你昨天的提交也带走了。

  区别,在后果能不能撤回。

  你写软件,最坏是回滚一次 commit,重来一遍。

  芯片这行不一样。设计一旦流片,也就是版图送进产线开始造,电路就被刻死在硅片上了,想改只能整批报废,从头再来。

  软件能打补丁,芯片不能。

  AI 造芯片

  人类须在环

  有意思的是,同一时间,Anthropic 自己也在硬件这条线上押注。

  7 月 9 日,它宣布和工程服务公司 UST 合作,把 Claude 送进芯片验证、汽车、制造这些现场,顺带给 UST 全球两万名工程师、架构师和顾问做培训。

  UST 手里有个叫 iDEC 的平台,专管在芯片量产之前,把硬件和硅片先验一遍。

  按 UST 的说法,这套流水线已经把验证周期砍掉一半以上,原来四天的活儿,如今 48 小时就能收工。

  现在,Claude Code 被接进去当大脑:读芯片的引脚定义和电路图纸,写好测试再跑一遍,然后拿真机跑出来的数据和电脑里的仿真模型对比,哪儿对不上就标出来。

  Anthropic 在那篇公告里提到,在这类出错代价极高的行业,让人来批、让每一步都留痕,是这套系统能真正上生产线的前提。

  Reddit 上,一位自称在 EDA 公司工作的用户没那么乐观:

  就算上了智能体和技能流程,离好用还差得远,跑通一条流程动辄几个月;数字电路和验证这两块的效果,明显好过模拟、混合信号和存储器。

  这句抱怨背后其实藏着一条规律。

  不管是你的代码库,还是三星的流水线,最先被 AI 跑通的都是验证。

  原因就一条:验证有标准答案,跑一遍就知道对错,不用等人来判。

  AI 不是要替掉谁

  是把一个人的产出撑开

  业内估算,System LSI 事业部约 6000 人。高通截至去年 9 月约有 52000 人。

  对坐在 System LSI 工位上的人来说,这意味着同样一块芯片市场,对面的人比你多出好几倍。

  那个入职刚满一年的工程师,就站在这个位置上:人手不够,工期照压,标准一点不降。

  所以 AI 在这儿被寄予的真正期待,是把一个人的产出撑开。

  重复的连线、重复的验证、重复的啃规范,这些最吃工时的活交出去,老手才腾得出手去啃真正难的部分,新人才接得住更重的活。

  那名工程师一天做完一个月的 USB 建模,AI 替他省下的,正是「先把 USB 标准啃透」这道门槛。

  一位半导体行业人士说:这种智能体跑得是真快,但没管住,出的就是大事。

  他的判断是,整体开发时间会继续被压缩,过去由人一步步执行的环节会不断减少,工程师最后守住的是两头:目标怎么定,结果对不对。

  工程师的活没有变少,只是换了形态。

  以前的本事,是能把一个验证环境搭出来;往后的本事,是知道 AI 搭出来的这个环境,哪一处不对。

  AI 能把一个月的工作压到一两天。但芯片一旦流片,谁也压不回去。

  参考资料:

  https://news.nate.com/view/20260812n19157?utm_source=chatgpt.com

  编辑:元宇