Google的Gemini模型更新频率惊人,按月推出新版本,7月是Gemini 3.6 Flash,8月为Gemini 3.7 Flash,9月则发布了Gemini 3.8 Flash。此前3.6和3.7 Flash的提升不太显著,让用户对Gemini的期待值降低,但3.8 Flash在能力上有了明显进步。
3.8 Flash的Token单价和前两代保持一致,价格上比豆包Seed2.1 Pro便宜,逼近DeepSeek V4 Pro峰值价格。然而,由于其最大特色是提升轮次,让模型多想、多说、多做几轮任务,导致同样任务下完成轮次增多,开销上涨。高推理档位的单任务输出Token比3.7 Flash多33%,平均任务成本从0.40美元涨到了0.58美元。
此次迭代主要提升了Agent能力,Arena的Agent能力排名从上一代的32名升到了14名,超越了大部分“Flash”等级的轻量级模型。例如在做四缸发动机的互动模拟时,3.8 Flash仅用1分钟且结果要素齐全,而3.7 Flash未画出图形,GPT - 5.6 luna和GLM - 5.3 flash未能正常渲染,DeepSeek V4 Flash虽能运行但效果不佳。
Gemini系列速度优势明显,高推理模式下的3.8 Flash每秒输出Token达300以上,市面上推理模型速度排名靠前的多为Gemini。这符合Google对Flash系列作为“worker agent”的定位,追求速度快、省Token。在吃豆人测试中,3.8 Flash仅用29秒,而GPT - 5.6 Sol xhigh用时1分35秒且效果不佳。
编辑观点:Gemini 3.8 Flash通过高频更新、能力提升和速度优势展现了竞争力,但价格与性能的平衡待优化,Gemini 3.5 Pro的难产也让其旗舰实力有待验证。