深度文章阅读

快速迭代之下,AI大模型的更新速度让人应接不暇

聚焦赛事内容、热点动态与专业视角,以更清晰的结构帮助读者把握重点,提升阅读效率与理解深度。

快速迭代之下,AI大模型的更新速度让人应接不暇
球友文章页展示图

快速迭代之下,AI大模型的更新速度让人应接不暇

新智元报道,AI领域发生的变革速度之快令人咋舌,仅仅在过去的两天内,就相继推出了四个全新的模型!在此之前,马斯克创办的xAI刚刚发布了Grok 4.7,紧接着OpenAI便毫不示弱,推出了价格腰斩的GPT-6 Sol和Luna,随时而来的是Anthropic的Claude Opus 5.5,其定价比上一代低了40%。随着这些巨头的猛烈攻势,9月22日,一张动图在社交平台X上热度飙升,浏览量几乎达到了百万。回望2023年,基于大模型的更新频率,平均每73天便换一代,预计到2026年,这一速度将缩短为18天一次。自ChatGPT上线以来,OpenAI和Anthropic已狂推出42个重磅模型,其中包括最新发布的GPT-6 Sol和Luna,使总数增至44。

数小时后,Stability AI的创始人Emad Mostaque不仅转发了这张图,还预言:“正如Alex所说,以这样的速度发展,明年年初的频率将达到每天发布一个。”在OpenAI和Anthropic的竞争下,出现了几乎“半月一更”的新常态。值得注意的是,“18天一更”这一预测或许更为保守,因为它仅以这两家企业为例。自年初至9月22日,Anthropic已发布8个旗舰模型,而OpenAI的数量则是6个,累计14个模型共跨度265天,平均下来仅为19天一次。在此期间,中国十家主要大模型开发商也累积推出至少28个旗舰模型,平均每9天多出一个。实际上,多个新模型的发布也常常是集中的,比如春节前一周便有四家厂商接连亮相,4月20日至24日的短短五天又迎来了四家轮番出击。两者相结合,结果是在每六天多一点的时间内便诞生一个全新旗舰,距离Emad预言的“每天一个”也不再遥不可及。

Anthropic模型发布的提速可谓是显而易见的。上半年其平均46天发布一个模型,而到下半年,这一数据已经压缩至26天。例如,Opus 4.8于5月28日问世,Opus 5则在7月24日推出,Opus 5.5则是9月22日释放。相较之下,OpenAI采用的是“憋大招后一次性发布”的策略,在GPT-6 Astra刚刚掀起了全网热潮的19天后,Sol和Luna便接连上线。一周后将举行DevDay大会,Altman感慨道,这是他记忆中OpenAI第一次在发布会前提出“要发布的内容太多了”的情况。为何发布频率骤涨?Anthropic在报告中揭示,AI正加速推动下一代AI的研发。今年2月,Claude能独立承担的AI研发任务不到1%,经过几个月的迅猛发展,5月上升到12%,7月达到22%,而到了8月,已达26%。OpenAI方面数据显示,截至8月中旬,AI智能体在科研工作日的投入已超出人类研究员的3.1倍(按每人每日8小时计算)。在Anthropic,模型的生成任务中四分之一已交由Claude自行负责,新模型源源不断地涌现,未来将更为迅速。 球友

目前,已经有多个项目在排队等待发布,Anthropic的Mike Krieger表示,Sonnet 5.5和Haiku 5.5将在未来几周内发布。另一方面,谷歌的Gemini 4自7月以来便在进行“有史以来最具雄心的预训练”,外界普遍预计将在年末亮相。此外,国内至少两家企业也已宣布下一代旗舰的研发工作正有条不紊地进行,唯独缺少最终的发布日期。

然而,模型更新的疯狂节奏让开发者们苦不堪言。想象一下,你在7月底熬夜几天几夜,终于将应用迁移至Opus 5,经过细致调整各项参数,一切顺利。然而,短短两个月后,Opus 5.5不期而至,你满心欢喜地尝试更换接口,却发现一些请求竟然直接报错。查阅这两家的最新官方提示词指南后会惊讶地发现,之前为老一代模型准备的提示词如今很多已然失效。

首先,开发者们需要进行减法。OpenAI在Astra指南中明确指出,以前过于细致的操作指令如今反而会导致效率低下,例如建议先“通读文档再改代码”之类的话语都可以剔除。Anthropic的指南也反映了类似趋势,以前必须附加“做完后检查一遍”的提示,如今在Opus 5中已经不再需要,因为该模型具备自动检查的能力。如果不删除这类提示,反而可能会导致过度检查。就连Opus 5.5中,关于“回答前仔细想想”的小提示也建议删除,去掉后不仅回复更快,质量也保持稳定。 球友

不过,删除旧提示的同时,开发者们还需创作新的内容,因为每一代模型都有其独特的特性。Opus 5.5在多轮交互中时常会反复探讨已经回答过的问题,导致计算资源的浪费,官方提供的解决方案是简单地将“已回答的内容当作过去”。此外,模型的参数和默认值也在悄悄变化。在Opus 5.5上,关闭思考模式的代码将直接报错404;而不写effort参数则会令默认档位从高降至中,随之而来的则是成本与效果的重新洗牌。对于这种变化,官方建议开发者重新验证effort设置,切忌将Opus 5的旧配置直接应用于新模型。

about image

以上种种因素,也就意味着每一代带来的调整都为开发人员增加了额外的负担。Anthropic的Lance Martin在视频中演示过一则案例,使用给Opus 4.8设计的老旧提示词,每张工单的成本是2.45美分,而直接换用Opus 5.5后降至2.02美分;再通过官方工具优化后,准确率提升至92%时,成本则进一步降至1.83美分。

除却这些变化,模型的迅速迭代也意味着它们的生命周期正在悄然缩短。今年,OpenAI已经发出了9次弃用通知,涉及超过40个模型和功能。令人意外的是,4月23日刚发布的GPT-5.5便计划在10月14日下架于ChatGPT和Codex平台,展示了这一行业快速更迭的残酷现实。 球友

觉得有用?分享给朋友

让更多人看到这篇内容