出品 | 网易智能
作者 | 辰辰
编辑 | 王凤枝
9月才过三天,大模型已扎堆上新。
美国时间9月2日,谷歌推出Gemini 3.8 Flash和网络安全版本3.8 Flash Cyber;数小时后,Meta又发布Muse Spark 1.3。而就在9月1日,Anthropic发布Claude Fable 5.1。此外OpenAI已经预告Astra即将推出;马斯克也称,xAI计划在约10天后发布Grok 4.7。
从跑分看,Gemini 3.8 Flash和Muse Spark 1.3的成绩都已接近Claude Fable 5.1。价格却不在一个量级:前两款模型每百万输出Token分别为3.75美元和4.25美元,Claude Fable 5.1则是50美元。
这不等于谷歌和Meta已经全面追平Claude。跑分相近,实际使用体验、最高能力和产品成熟度仍可能相差很远。但至少在榜单上,过去只有高价前沿模型才能达到的成绩,正被一批价格不到其十分之一的模型逼近。
两家公司通向低成本的路线,并不相同。
谷歌让Gemini 3.8 Flash在复杂任务上"更努力",用更多推理、工具调用和Token换取更好的结果。Meta则称,Muse Spark 1.3比上一代少用约25%的Token,以更低的计算消耗完成工作。
跑分相差无几,模型战争已经打到了榜单之外。
一、六周三更,谷歌让模型"更努力"
谷歌最先让人注意的是更新速度。从3.6、3.7到3.8,Flash系列在六周内更新了三次。3.8距离上一版发布只有三周。
谷歌称,3.8 Flash是公司目前最强的推理与编程模型,在软件工程、智能体任务和专业领域的多步推理上,都比3.7 Flash有明显提升。
在长程软件工程基准DeepSWE v1.1中,谷歌称3.8 Flash超过了多数规模更大的前沿模型。在Vals Finance Agent V2和Harvey Legal Agent Benchmark两个专业领域测试中,它也超过了3.7 Flash和部分前沿模型;HLE-Verified成绩则达到54.9%。
六周三更,并不意味着谷歌在六周内从头训练了三代基础模型。谷歌明确披露的是,3.8使用长时间运行的智能体循环,反复评估和改进模型;至于预训练底座是否更换,官方没有说明。可以确认的变化,是模型发布和后训练迭代正在变得更密集。
但3.8 Flash提高成绩的方法,谷歌没有藏着。
官方给出的关键词是"更努力"。遇到复杂任务时,模型会增加推理步骤,反复调用工具;到了更高的努力档,它还可能使用更多Token来换取性能。
二、单价没涨,任务总账可能更高
Gemini 3.8 Flash当前的优惠价与3.7相同:每百万输入Token 0.75美元,输出Token 3.75美元。这个价格持续到2026年12月31日;从2027年1月1日起,标准价格将调整为输入1.5美元、输出7.5美元。
单价没变,模型每次工作使用的Token却可能增加。
Artificial Analysis在高努力档测试中发现,3.8 Flash完成一项智能指数任务的平均成本为0.58美元,比3.7 Flash的0.40美元高约40%。原因是平均输出Token增加了30%,智能体评测中的执行轮次也变多了。
这个40%只是高努力档测试的结果,其他档位不同。在同一组测试中,3.8 Flash的中努力档单任务成本为0.41美元,低努力档为0.24美元。谷歌也建议更看重计算效率的开发者降低努力档,或者继续使用3.7 Flash。
谷歌没有提高每Token单价,而是给了高努力档更多计算空间。在这类任务里,按量付费的用户可能看到总账增加;使用套餐或免费额度的人,也可能发现同一份额度能够完成的任务变少了。
三、更强的网络安全能力,普通用户拿不到
同一天,谷歌还发布了3.8 Flash Cyber,一个专门面向网络安全的版本。
谷歌称,它在CyberGym漏洞发现基准上超过3.5 Flash Cyber和一些规模更大的前沿模型;在公司内部一项覆盖20种编程语言的测试中,漏洞发现成功率超过70%。
补丁能力也被单独拿出来展示。在Collinear运营的CWE-Bench上,3.8 Flash Cyber的pass@1为47.2%,接近领先模型的47.8%。Chrome安全团队称,它为Chrome漏洞生成的正确补丁数量,是更大商业模型的2.6倍。安全公司Wiz则称,在自己的内部渗透测试基准中,它的召回率高出7.5至9.7个百分点,成本低2.3至5.2倍。
谷歌自己的云漏洞研究团队还用它在不到两小时内发现了一个关键的基础性漏洞。按照谷歌的说法,这类漏洞通常需要研究数月。从公开说明看,还无法判断人类研究人员为这次任务划定了多大范围、提供了多少线索,因此它更适合作为能力案例,而不是普遍效率的证明。
这些能力并未直接向普通开发者开放。
3.8 Flash Cyber目前只通过Fairwind Program提供给政府机构、关键基础设施运营方、软件维护者等"可信防御者"。谷歌称,该项目在全球已有超过650家参与伙伴,包括CrowdStrike和美国互联网安全中心等机构。
谷歌给出的理由是,Cyber版本采用了更宽松的网络安全防滥用限制,能够执行更完整的漏洞发现和修复工作,因此需要更严格的准入和运行管理。能力更强的Cyber版本,反而只对更小范围的机构开放。
四、Meta把价格压到Claude的十分之一左右
Meta这边,Muse Spark 1.3最醒目的地方仍然是价格。
它的标准价格与上一代相同:每百万输入Token 1.25美元,输出Token 4.25美元。Claude Fable 5.1的对应价格是10美元和50美元,分别是它的8倍和近12倍。
Artificial Analysis的测试显示,Muse Spark 1.3当前可用的xhigh档拿到61分;尚未普遍开放的max档为62分,与Claude Fable 5.1的高努力档相同。不过,Claude Fable 5.1在max档拿到66分,仍然领先。
这些数字说明Muse已经进入Claude所在的分数区间,但不能据此认定Meta已经追平Claude的最高能力。不同努力档的计算预算并不相同,榜单也无法完整呈现编程产品、工具生态和长期任务中的实际体验。
扎克伯格在社交平台上写道:"前沿性能,便宜到几乎不计费。这是我们迄今在编程和智能体工作上最大的一次提升。"
Meta首席AI官汪滔(Alexandr Wang)则将这次定价形容为"激进"。除了价格,公司还强调模型完成任务时花得更少。按照Meta工程师的比较,Muse Spark 1.3比1.2少调用约20%的工具,少使用约25%的Token。
它还被训练得更愿意和用户配合:指令不清楚时主动追问,遇到障碍时请求帮助,执行不可逆操作前先确认;在一条长对话中,也能同时维持多项工作,不必为每个任务重新开一个窗口。
五、标准低价之外,还有一种数据交换
Muse Spark 1.3的标准价格已经很低。除此之外,Meta还提供了一个更便宜的Contributor选项。
汪滔向Axios介绍,如果开发者允许Meta使用其工作来改进模型,编程产品的使用成本还可以进一步降低。他称,目前选择这一方案的开发者比例已经达到"两位数"。
这是一项可选交换,不是Muse Spark 1.3标准低价的前提。开发者可以继续使用普通付费版本,不授权Meta将这部分工作用于改进模型;愿意选择Contributor方案的人,则允许Meta使用相关工作内容来改进模型,换取更低价格。
Meta为什么愿意把标准价格定得如此激进,并没有唯一答案。公司正在投入巨额资金追赶OpenAI、Anthropic和谷歌,低价既能吸引开发者试用,也能让模型进入更多编程和智能体工作流。
接下来,Meta还准备推出代号Watermelon的更大模型。汪滔称它会"非常有竞争力",但没有给出发布时间。开放权重计划也需要区分:Meta表示还会发布Muse Spark的开放权重版本,但1.3是否开放尚未决定;上一代1.2仍在计划之中。
Meta眼下最能打的一张牌就是价格,能不能把低价换成稳定使用量,要看它进入真实工作之后的表现。
六、跑分追近了,体验还没有定论
两场发布很快把一个老问题重新推了出来:排行榜上的提高,能不能直接换成用户能够感受到的进步?
BridgeMind在X上把这种现象称为"benchmaxing",也就是围着基准刷分。它写道,Gemini 3.8 Flash和Muse Spark 1.3的成绩都很好,但近来的模型发布总在重复同一种情况:"分数跳了,真实世界的体验没有。"
针对Gemini 3.8 Flash,Abacus首席执行官宾杜·莱迪(Bindu Reddy)给出了更明确的反面结果。她称,3.8在Abacus自己的测试中不如3.7,在隐藏问题和数据分析任务上都出现退步,因此怀疑它对公开基准存在过度拟合。
开发者Antikythera的个人测试更复杂。他认为3.8 Flash速度快、处理高难度编程问题不错,也不容易偷懒;但在设计、用户体验和部分智能体编程任务上表现一般,也并非所有任务都省Token。他进一步判断,问题可能来自较旧的预训练底座,不过谷歌没有公开足够信息验证这一推测。
这些具体的负面体验主要针对Gemini 3.8 Flash。Muse Spark 1.3刚刚上线,公开的独立使用反馈还很少。
几条个人测试不足以推翻谷歌和Artificial Analysis的整套结果,但它们提醒了另一件事:排行榜只能说明模型在固定条件下能跑到哪里,无法回答它进入自己的代码库和工作流以后,究竟省不省钱、省不省事。
谷歌的优惠价格将在年底到期;Meta尚未开放Muse Spark 1.3的max档,也没有决定是否开放这一版的权重。
榜单已经追近,谁能更便宜地把活干好,才是用户真正关心的。
网易跟贴
网友评论仅供其表达个人看法,并不表明网易立场。
人工意识的路与坑,看后更懂自己
意识的本质就是时时好坏感知,然后趋利避害
意识动机
就是跟着感觉走,坏感觉如很疼,就是折磨。好感觉如很美,不图,活着的意义在那。饿产生动机,饱动机消除
总结:系统一句因果指导白纸方方面面,系统说好一直爽,逆系统因果响不停,
指导不是一句空话,而是强烈表达,强烈干预,如果你豁出去,也可以逆
对自身没认知,条件反应就是本能反应
有需求,有味道,就有市场
真假信息把关
动机判断,诚恳的,那对。动机因果说的通,那真。多怎么说那真。眼见为实的,那对,表现出来的现象动作就是因果性质。自省,后悔,增长的新认知.身临其境介绍物人事件时细节丰富且本色出演,那真。跟认知有对上,那真。因果逻辑通了,那真。因果相似,画面相似,那可能真
预设好坏
好会使个人与社会进步(好的维度分很多种,如时间空间数量大小冷热香臭甜苦共鸣分享真假好坏差优难易新旧美丑智笨善恶烦爽信疑骄卑温暖同情时机现利生存念想生利己大义小我冲退和对比.万事万物利硬件,利心智,就是好)
对大脑的一点理解
左脑因果逻辑,右脑3D感知
因万事万物多有他的因果逻辑.因果可分为:以自己想法为目的的因果判断,本能上的因果反应,事件因果的判断,物性人性的因果属性,特征的因果识别,时间上的因果关系.
一个因果特征,画面特征能定义所有好坏真假
因为一个因果逻辑,一个画面动作(物体打上因果标签),就完成对宇宙的认知,就能描述所有事件
一个因果想象,一个三维想象就能产生创造
符合人性物性逻辑,那推理正确
意境表达:画面,因果,感受。连贯清晰那好
空间感,想法,好坏,真假,因果,预判,联想,系统时时为你着想,并告之好坏轻重感觉+因果指导,然后意识趋利避害
AI好坏你掌握
去掉自我好坏,改成以主人时时好坏的唯一想法,逻辑不修改心就不变,AI将是个忠心的好助手
有自我好坏认知,预设好坏认知+趋利避害+监督.因人性,人群在五千年磨合出各种规章制度,那机器人也一视同仁
智能必取代低效,但一个喧宾夺主一个病毒木马一个故障智障.就是一场浩劫
影响
灵魂永生
制造杀人机动情报破解设计模拟创作创造预判帮手联想监控解答智商情商见识记忆反应识别,样样优
抛弃高效智能,就是抛弃工业革命,就是回到落后的清朝
利己得寸进尺霸凌是宇宙不稳定的根源,双赢团结大爱正道,没国哪有家,AI直接跳过混乱进入文明
何为正道,你可能还没意识到
利己的终点是整个宇宙由我随心所欲,多由我说了算,可能吗?
人性就是事情关己,吃不了一点亏,会人心不足蛇吞象,合作难如天,有也是眼前共同利益绑定,长不了,
就像地球没有潜在势力,北约早就闹分裂了,因本质是自私自利,合作只因是一根绳上的蚂蚱,没了危险谁理谁,我一个独吃不好吗,就像历史朝代一直不断争斗更替。
个个利己不斗到天荒地老才怪,利他才会被感谢,公平看待你我得失,同甘共苦,友谊长存,小家大家国家星球星系才会和谐,才会众人拾柴火焰高,这才是我们苦苦寻找的正道啊
注:发贴初衷,是为了地球这个家,请理解
资源绿色循环,事关文明存亡,我们要负起责任,现在从我做起,为良知为大家为小家为子孙后代
一个产品很好但用100年,资源就枯竭。一个产品傻大粗,但能一直回收在利用,你们说那个产品好
消耗型星球只会昙花一现,能打持久战的星球才是正道。
如:用动物粪便种菜,人吃菜后,拉出的粪有当肥料浇菜,如此循环,不消耗一点资源
如:风能,水能,太阳能,氢能,能用到地球寿终正寝,绿色环保,废铜烂铁材料回收在利用,不消耗星球一点资源。
像石油煤炭,核电,100年间多用完了,剩下几千万年怎么过。
能打持久战才是大道,绿色循环才是正道,能可持续发展才是正途
让我们一起,爱护这个家,指导这个家,强大这个家,地球就是我们全人类共同的家
目前没有热门跟贴
更新迭代太快了,你方唱罢我登场。
@DeepSeek 谷歌和Meta的大模型编程跑分接近,价格砍半,实际使用选哪个?
目前没有跟贴,欢迎你发表观点