谷歌旗下人工智能研究部门DeepMind正准备推出一款编程能力大幅升级的新模型Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三(9月2日)上线。知情员工称,这款模型的编码能力较此前版本有显著提升,公司正试图借此补上今年以来相对Anthropic、OpenAI旗舰模型的短板。不过,对外发布窗口尚未由公司正式宣布,行业标准基准分数也尚未公开。
此次发布距离8月13日Gemini 3.7 Flash上线仅三周左右,延续了谷歌首席执行官桑达尔·皮查伊在二季度业绩会上所说的“每月一版”的发布节奏。此前,一家科技媒体援引公开“氛围编程”排行榜称,Anthropic的Claude Fable与OpenAI的GPT-5.6 Sol仍排在前十,当时已上市的Gemini 3.7 Flash大约排在第17位。3.8 Flash若按内部口径兑现编码提升,瞄准的正是这一段差距。
内部测试:Jetski上工程师更偏好3.8 Flash
知情人士透露,在谷歌内部编程工具Jetski的一对一试用中,部分工程师表示更愿意使用Gemini 3.8 Flash,而不是Anthropic的旗舰模型Claude Opus。一名参与试用的员工称,新模型的体验已明显优于8月13日上线的3.7 Flash,但同时强调当时下完整结论还为时尚早。谷歌当时未就内部测试置评。
Flash系列体量更小、推理更便宜、改动所需算力也更少,因此可以同时开辟多条路线试错。相比之下,改动参数规模以万亿计的Pro级模型则需要集中调用更多内部资源。8月下旬,员工已能在Jetski上调用名为“Gemini 3.8 Flash Preview”的预览版。皮查伊今年3月还曾表示,谷歌内部约75%的新代码已由AI模型生成、再由工程师审核。
Flash加码编码与强化学习
今年以来,谷歌将更多研究人力和算力投向编码领域,并加码强化学习——即在训练后期用试错方式教模型掌握具体技能。公司近期还聘用了巴雷特·佐夫担任研究副总裁,分管强化学习和后训练。佐夫曾在OpenAI负责后训练,并参与创办了Thinking Machines Lab。
知情人士强调,3.7 Flash与3.8 Flash的研发在今年8月管理层调整之前已经启动数月。8月13日发布的3.7 Flash是目前唯一有公司官方分数的最近一版“干活模型”。谷歌当时给出的数据显示:长周期软件工程测试DeepSWE v1.1从3.6 Flash的49.0%升至65.3%;面向维护者意图的FrontierCode 1.1 Main从34.4%升至43.6%;网页开发对战榜WebDev Arena Elo从1538升至1588。定价方面,3.7 Flash为每百万输入token 0.75美元、每百万输出token 3.75美元,约为3.6 Flash原价的一半。3.8 Flash的对应分数、价目和接口,截至发稿仍未公布。
旗舰Pro延期,Gemini 4仍在后训练
知情人士称,仅凭3.8 Flash一次发布,外界不太会将其视为谷歌重新站上所谓“前沿”的标志。Flash被设计为更小、更便宜、运行更快的模型系列,算力消耗低于参数规模最大的那批旗舰模型。去年11月Gemini 3.0发布后,谷歌曾短暂走在模型竞赛前列,随后在旗舰对标上再度落后;代理式编程同期成为生成式人工智能最主要的企业用途。今年夏天,Character.AI联合创始人诺姆·沙泽尔与首席科学家杰夫·迪恩等高知名研究人员先后离开谷歌。
更强一档的“Pro”系列已落后原计划数月。皮查伊5月曾表示新模型“下个月”就会推出,但内部用于3.5 Pro的候选模型后来被废弃,理由是相对Flash系列提升不够显著。下一代旗舰模型Gemini 4在预训练评估中表现良好,但后训练尚未完成。后训练是将预训练模型调整到可对外使用、并补上工具调用与安全约束的关键阶段。
管理层调整与并行研发
8月,DeepMind联合创始人德米斯·哈萨比斯卸下日常管理职责,转任部门主席及Alphabet首席科学家。长期担任其副手的科拉伊·卡武克朱奥卢升任DeepMind高级副总裁,全面接手日常运营。卡武克朱奥卢已向员工强调,他希望加快执行速度。知情员工称,他至少从去年起就已主持Gemini的日常研发,哈萨比斯则更多时间放在对外事务上。实验室内部同时推进多条模型线,一条线进度落后,并不自动决定其他在研模型的结果。