说出来你可能不信,九月份刚过半,我们组的"主力编码模型"已经换了四回。
我是一家中厂的后端技术负责人,手底下十几号人,年初开始全面推AI辅助研发。本来是好事,直到我发现,追新模型这件事,正在变成一种新的内耗。
第一回,是九月初。某家发了新一代旗舰,技术群里刷屏,说代码能力吊打一切。架构师小哥第二天就在周会上拍板:换,全员切过去。
切模型不是改个URL的事。我们内部的AI研发平台要接新API,prompt模板要重调,权限和审计要重新过一遍安全,最麻烦的是几个深度依赖老模型输出格式的代码审查机器人,输出一变,规则全废。折腾了两天,刚稳定。
第二回,另一家跟着发新版,上下文窗口直接拉到200万token,又有人喊:这个能把整个仓库塞进去!再换。于是又一轮适配。
第三回,主打便宜,缓存价格降了75%,财务找过来说你们一个月token费用小十万,这个便宜模型要不要评估下?好,再切。
第四回,又是一家发新的,群里跑分截图满天飞。架构师在群里@我:"这个SWE分数更高,咱们是不是跟上?"
我当时正在改一个被第二版模型生成出来的诡异bug——它为了"优雅",把一个简单的重试逻辑包了三层抽象,线上超时排查了半宿。我直接回他:不换了,再换我走人。
群里安静了一分钟。
后来我拉了个会,把这半个月的账算了一遍,大家才意识到问题有多离谱:
第一,模型切换的人力成本没人算。四次切换,两个平台工程师几乎没干别的活,十几个研发每人重配环境、重养习惯,保守估计烧掉一百多工时。这些时间本来能做完两个迭代的需求。
第二,所谓"跑分更高"和"我们用着更好"根本是两回事。榜单测的是通用任务,我们的场景是一个有十年代码、技术栈又老又杂的内部系统。新模型在干净的开源项目上刷高分,到我们这堆祖传代码里,照样瞎。我统计过,切到第三版后,AI生成代码的采纳率不升反降了8%,因为它总按新框架的写法改造老代码。
第三,也是最烦的——每次换模型,输出风格都变。这个版本喜欢写注释,下个版本喜欢抽函数,再下个版本热衷于设计模式。同一个模块,前后AI生成的代码像四个人写的,代码库的一致性被搅得稀碎。review的同事天天怀疑人生。
我不是反对用新模型,我反对的是"用追新手机的方式追生产工具"。手机系统你更不更,影响的是你自己;生产模型是全团队的地基,地基一个月换四回,上面什么楼都盖不稳。
会上我立了三条规矩,后来在整个研发部推开了:
一,建立"模型评估流水线"。任何想进生产的模型,先跑我们自己的评测集——两百道从真实业务里抠出来的题,含老代码理解、SQL优化、边界case、安全规范,跑过基线再说话。榜单分数只作参考,自己的考场才算数。
二,锁版本。主力模型一个季度评一次,没重大代际差距不换。小版本更新先在小范围灰度一周,看采纳率和线上问题数,数据说话。
三,抽象一层。我们在所有业务系统和模型之间加了个统一网关,业务侧只认内部接口,具体后面接哪家模型、怎么按任务路由、出问题怎么一键回滚,都在网关层搞定。以后再换模型,改配置而不是改代码。
对了。顺嘴提一句,技术大厂,前后端-测试机会,全国一线及双线城市均有坑位,待遇和稳定性还不错,感兴趣看看~
规矩立完这两周,世界清净了。大家不再在群里讨论"今天谁又第一了",重新开始讨论需求和设计。那个一开始最激进的架构师,前几天偷偷跟我说,他算了笔账,光省下来的切换工时,一个季度够他多招一个人。
这个行业现在的节奏就是这样,模型一周一发布,榜单一天一洗牌,热搜天天教你"再不跟上就淘汰了"。但越是这种时候,越要想明白一件事:厂商发版是它们的KPI,不是你的。它们需要你焦虑,需要你追,需要你觉得手上的已经过时了——这样新模型才有流量。
可你的目标不是用上最新的模型,是把东西做出来、做稳定、做出价值。
潮水天天换方向,游泳的人不该跟着浪头乱扭。定好自己的泳道,比抢第一块冲浪板重要多了。
阅读全文
171