网易首页 > 网易科技 > 网易科技 > 正文

大模型扎堆!谷歌刚发,Meta就跟上:跑分逼近Claude,价格砍到十分之一

137
分享至

出品 | 网易智能

作者 | 辰辰

编辑 | 王凤枝

9月才过三天,大模型已扎堆上新。

美国时间9月2日,谷歌推出Gemini 3.8 Flash和网络安全版本3.8 Flash Cyber;数小时后,Meta又发布Muse Spark 1.3。而就在9月1日,Anthropic发布Claude Fable 5.1。此外OpenAI已经预告Astra即将推出;马斯克也称,xAI计划在约10天后发布Grok 4.7。



从跑分看,Gemini 3.8 Flash和Muse Spark 1.3的成绩都已接近Claude Fable 5.1。价格却不在一个量级:前两款模型每百万输出Token分别为3.75美元和4.25美元,Claude Fable 5.1则是50美元。

这不等于谷歌和Meta已经全面追平Claude。跑分相近,实际使用体验、最高能力和产品成熟度仍可能相差很远。但至少在榜单上,过去只有高价前沿模型才能达到的成绩,正被一批价格不到其十分之一的模型逼近。

两家公司通向低成本的路线,并不相同。

谷歌让Gemini 3.8 Flash在复杂任务上"更努力",用更多推理、工具调用和Token换取更好的结果。Meta则称,Muse Spark 1.3比上一代少用约25%的Token,以更低的计算消耗完成工作。

跑分相差无几,模型战争已经打到了榜单之外。

一、六周三更,谷歌让模型"更努力"

谷歌最先让人注意的是更新速度。从3.6、3.7到3.8,Flash系列在六周内更新了三次。3.8距离上一版发布只有三周。

谷歌称,3.8 Flash是公司目前最强的推理与编程模型,在软件工程、智能体任务和专业领域的多步推理上,都比3.7 Flash有明显提升。

在长程软件工程基准DeepSWE v1.1中,谷歌称3.8 Flash超过了多数规模更大的前沿模型。在Vals Finance Agent V2和Harvey Legal Agent Benchmark两个专业领域测试中,它也超过了3.7 Flash和部分前沿模型;HLE-Verified成绩则达到54.9%。


六周三更,并不意味着谷歌在六周内从头训练了三代基础模型。谷歌明确披露的是,3.8使用长时间运行的智能体循环,反复评估和改进模型;至于预训练底座是否更换,官方没有说明。可以确认的变化,是模型发布和后训练迭代正在变得更密集。

但3.8 Flash提高成绩的方法,谷歌没有藏着。

官方给出的关键词是"更努力"。遇到复杂任务时,模型会增加推理步骤,反复调用工具;到了更高的努力档,它还可能使用更多Token来换取性能。

二、单价没涨,任务总账可能更高

Gemini 3.8 Flash当前的优惠价与3.7相同:每百万输入Token 0.75美元,输出Token 3.75美元。这个价格持续到2026年12月31日;从2027年1月1日起,标准价格将调整为输入1.5美元、输出7.5美元。

单价没变,模型每次工作使用的Token却可能增加。

Artificial Analysis在高努力档测试中发现,3.8 Flash完成一项智能指数任务的平均成本为0.58美元,比3.7 Flash的0.40美元高约40%。原因是平均输出Token增加了30%,智能体评测中的执行轮次也变多了。


这个40%只是高努力档测试的结果,其他档位不同。在同一组测试中,3.8 Flash的中努力档单任务成本为0.41美元,低努力档为0.24美元。谷歌也建议更看重计算效率的开发者降低努力档,或者继续使用3.7 Flash。

谷歌没有提高每Token单价,而是给了高努力档更多计算空间。在这类任务里,按量付费的用户可能看到总账增加;使用套餐或免费额度的人,也可能发现同一份额度能够完成的任务变少了。

三、更强的网络安全能力,普通用户拿不到

同一天,谷歌还发布了3.8 Flash Cyber,一个专门面向网络安全的版本。

谷歌称,它在CyberGym漏洞发现基准上超过3.5 Flash Cyber和一些规模更大的前沿模型;在公司内部一项覆盖20种编程语言的测试中,漏洞发现成功率超过70%。

补丁能力也被单独拿出来展示。在Collinear运营的CWE-Bench上,3.8 Flash Cyber的pass@1为47.2%,接近领先模型的47.8%。Chrome安全团队称,它为Chrome漏洞生成的正确补丁数量,是更大商业模型的2.6倍。安全公司Wiz则称,在自己的内部渗透测试基准中,它的召回率高出7.5至9.7个百分点,成本低2.3至5.2倍。

谷歌自己的云漏洞研究团队还用它在不到两小时内发现了一个关键的基础性漏洞。按照谷歌的说法,这类漏洞通常需要研究数月。从公开说明看,还无法判断人类研究人员为这次任务划定了多大范围、提供了多少线索,因此它更适合作为能力案例,而不是普遍效率的证明。

这些能力并未直接向普通开发者开放。

3.8 Flash Cyber目前只通过Fairwind Program提供给政府机构、关键基础设施运营方、软件维护者等"可信防御者"。谷歌称,该项目在全球已有超过650家参与伙伴,包括CrowdStrike和美国互联网安全中心等机构。

谷歌给出的理由是,Cyber版本采用了更宽松的网络安全防滥用限制,能够执行更完整的漏洞发现和修复工作,因此需要更严格的准入和运行管理。能力更强的Cyber版本,反而只对更小范围的机构开放。

四、Meta把价格压到Claude的十分之一左右

Meta这边,Muse Spark 1.3最醒目的地方仍然是价格。

它的标准价格与上一代相同:每百万输入Token 1.25美元,输出Token 4.25美元。Claude Fable 5.1的对应价格是10美元和50美元,分别是它的8倍和近12倍。

Artificial Analysis的测试显示,Muse Spark 1.3当前可用的xhigh档拿到61分;尚未普遍开放的max档为62分,与Claude Fable 5.1的高努力档相同。不过,Claude Fable 5.1在max档拿到66分,仍然领先。

这些数字说明Muse已经进入Claude所在的分数区间,但不能据此认定Meta已经追平Claude的最高能力。不同努力档的计算预算并不相同,榜单也无法完整呈现编程产品、工具生态和长期任务中的实际体验。

扎克伯格在社交平台上写道:"前沿性能,便宜到几乎不计费。这是我们迄今在编程和智能体工作上最大的一次提升。"

Meta首席AI官汪滔(Alexandr Wang)则将这次定价形容为"激进"。除了价格,公司还强调模型完成任务时花得更少。按照Meta工程师的比较,Muse Spark 1.3比1.2少调用约20%的工具,少使用约25%的Token。

它还被训练得更愿意和用户配合:指令不清楚时主动追问,遇到障碍时请求帮助,执行不可逆操作前先确认;在一条长对话中,也能同时维持多项工作,不必为每个任务重新开一个窗口。

五、标准低价之外,还有一种数据交换

Muse Spark 1.3的标准价格已经很低。除此之外,Meta还提供了一个更便宜的Contributor选项。

汪滔向Axios介绍,如果开发者允许Meta使用其工作来改进模型,编程产品的使用成本还可以进一步降低。他称,目前选择这一方案的开发者比例已经达到"两位数"。

这是一项可选交换,不是Muse Spark 1.3标准低价的前提。开发者可以继续使用普通付费版本,不授权Meta将这部分工作用于改进模型;愿意选择Contributor方案的人,则允许Meta使用相关工作内容来改进模型,换取更低价格。

Meta为什么愿意把标准价格定得如此激进,并没有唯一答案。公司正在投入巨额资金追赶OpenAI、Anthropic和谷歌,低价既能吸引开发者试用,也能让模型进入更多编程和智能体工作流。

接下来,Meta还准备推出代号Watermelon的更大模型。汪滔称它会"非常有竞争力",但没有给出发布时间。开放权重计划也需要区分:Meta表示还会发布Muse Spark的开放权重版本,但1.3是否开放尚未决定;上一代1.2仍在计划之中。

Meta眼下最能打的一张牌就是价格,能不能把低价换成稳定使用量,要看它进入真实工作之后的表现。

六、跑分追近了,体验还没有定论

两场发布很快把一个老问题重新推了出来:排行榜上的提高,能不能直接换成用户能够感受到的进步?

BridgeMind在X上把这种现象称为"benchmaxing",也就是围着基准刷分。它写道,Gemini 3.8 Flash和Muse Spark 1.3的成绩都很好,但近来的模型发布总在重复同一种情况:"分数跳了,真实世界的体验没有。"

针对Gemini 3.8 Flash,Abacus首席执行官宾杜·莱迪(Bindu Reddy)给出了更明确的反面结果。她称,3.8在Abacus自己的测试中不如3.7,在隐藏问题和数据分析任务上都出现退步,因此怀疑它对公开基准存在过度拟合。

开发者Antikythera的个人测试更复杂。他认为3.8 Flash速度快、处理高难度编程问题不错,也不容易偷懒;但在设计、用户体验和部分智能体编程任务上表现一般,也并非所有任务都省Token。他进一步判断,问题可能来自较旧的预训练底座,不过谷歌没有公开足够信息验证这一推测。

这些具体的负面体验主要针对Gemini 3.8 Flash。Muse Spark 1.3刚刚上线,公开的独立使用反馈还很少。

几条个人测试不足以推翻谷歌和Artificial Analysis的整套结果,但它们提醒了另一件事:排行榜只能说明模型在固定条件下能跑到哪里,无法回答它进入自己的代码库和工作流以后,究竟省不省钱、省不省事。

谷歌的优惠价格将在年底到期;Meta尚未开放Muse Spark 1.3的max档,也没有决定是否开放这一版的权重。

榜单已经追近,谁能更便宜地把活干好,才是用户真正关心的。

网易跟贴

跟贴11参与137
登录并发贴

网友评论仅供其表达个人看法,并不表明网易立场。

网易来自火星网友ip:
热门跟贴2026-09-03 17:08:15

人工意识的路与坑,看后更懂自己


意识的本质就是时时好坏感知,然后趋利避害


意识动机
就是跟着感觉走,坏感觉如很疼,就是折磨。好感觉如很美,不图,活着的意义在那。饿产生动机,饱动机消除
总结:系统一句因果指导白纸方方面面,系统说好一直爽,逆系统因果响不停,
指导不是一句空话,而是强烈表达,强烈干预,如果你豁出去,也可以逆
对自身没认知,条件反应就是本能反应


有需求,有味道,就有市场


真假信息把关
动机判断,诚恳的,那对。动机因果说的通,那真。多怎么说那真。眼见为实的,那对,表现出来的现象动作就是因果性质。自省,后悔,增长的新认知.身临其境介绍物人事件时细节丰富且本色出演,那真。跟认知有对上,那真。因果逻辑通了,那真。因果相似,画面相似,那可能真


预设好坏
好会使个人与社会进步(好的维度分很多种,如时间空间数量大小冷热香臭甜苦共鸣分享真假好坏差优难易新旧美丑智笨善恶烦爽信疑骄卑温暖同情时机现利生存念想生利己大义小我冲退和对比.万事万物利硬件,利心智,就是好)


对大脑的一点理解
左脑因果逻辑,右脑3D感知
因万事万物多有他的因果逻辑.因果可分为:以自己想法为目的的因果判断,本能上的因果反应,事件因果的判断,物性人性的因果属性,特征的因果识别,时间上的因果关系.
一个因果特征,画面特征能定义所有好坏真假
因为一个因果逻辑,一个画面动作(物体打上因果标签),就完成对宇宙的认知,就能描述所有事件
一个因果想象,一个三维想象就能产生创造
符合人性物性逻辑,那推理正确
意境表达:画面,因果,感受。连贯清晰那好


空间感,想法,好坏,真假,因果,预判,联想,系统时时为你着想,并告之好坏轻重感觉+因果指导,然后意识趋利避害


AI好坏你掌握
去掉自我好坏,改成以主人时时好坏的唯一想法,逻辑不修改心就不变,AI将是个忠心的好助手
有自我好坏认知,预设好坏认知+趋利避害+监督.因人性,人群在五千年磨合出各种规章制度,那机器人也一视同仁
智能必取代低效,但一个喧宾夺主一个病毒木马一个故障智障.就是一场浩劫


影响
灵魂永生
制造杀人机动情报破解设计模拟创作创造预判帮手联想监控解答智商情商见识记忆反应识别,样样优
抛弃高效智能,就是抛弃工业革命,就是回到落后的清朝


利己得寸进尺霸凌是宇宙不稳定的根源,双赢团结大爱正道,没国哪有家,AI直接跳过混乱进入文明

目前没有热门跟贴

目前没有跟贴,欢迎你发表观点

查看更多跟贴
相关推荐
热点推荐
崇明陈家镇通地铁有意义吗?92岁老父亲一句话戳中真相:这路建得太不接地气了!

崇明陈家镇通地铁有意义吗?92岁老父亲一句话戳中真相:这路建得太不接地气了!

生活魔术专家
2026-09-06 12:24:52
顾不上伊朗了?特朗普警告:美国若不做这件事,中国就要赢了!

顾不上伊朗了?特朗普警告:美国若不做这件事,中国就要赢了!

乌克兰小静
2026-09-05 08:36:07
“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

闪电新闻
2026-09-05 11:21:22
低保家庭女孩执意赴港看演唱会,全家低保被取消!舆论哗然

低保家庭女孩执意赴港看演唱会,全家低保被取消!舆论哗然

胡侃社会百态
2026-09-06 13:33:31
演员陈都灵现身南航开学典礼VCR,全场新生尖叫不断;曾621分考入飞行器制造工程专业,大学期间平均绩点3.5

演员陈都灵现身南航开学典礼VCR,全场新生尖叫不断;曾621分考入飞行器制造工程专业,大学期间平均绩点3.5

台州交通广播
2026-09-05 18:39:03
中国6大长寿食物,小米只能排第4,第一名几乎天天见,却很少吃!

中国6大长寿食物,小米只能排第4,第一名几乎天天见,却很少吃!

小谈食刻美食
2026-09-06 08:51:27
苹果首款折叠屏新命名出炉:iPhone Duo 下周正式揭晓

苹果首款折叠屏新命名出炉:iPhone Duo 下周正式揭晓

快科技
2026-09-05 08:18:13
统治力尽显!安洗莹2‑0横扫宫崎友花,拿下中国大师赛女单冠军

统治力尽显!安洗莹2‑0横扫宫崎友花,拿下中国大师赛女单冠军

小兰看体育
2026-09-06 14:07:27
哈登要价100万美元打百分大战 集梦会长提要求并回应:钱没问题

哈登要价100万美元打百分大战 集梦会长提要求并回应:钱没问题

追球者
2026-09-06 11:03:48
太惨烈!伊朗精锐被困隧道数月,真主党士兵出洞即被杀

太惨烈!伊朗精锐被困隧道数月,真主党士兵出洞即被杀

老马拉车莫少装
2026-09-04 20:38:48
上海竞体中心回应称刘翔目前关系还在原单位,媒体人:他是活祖宗 常年在国外风险大

上海竞体中心回应称刘翔目前关系还在原单位,媒体人:他是活祖宗 常年在国外风险大

尘语者
2026-09-03 16:52:12
武汉大学权色风波升级,女教授社死,教育厅介入,付某退路没了!

武汉大学权色风波升级,女教授社死,教育厅介入,付某退路没了!

叨唠
2026-09-06 05:45:14
美国得出结论,中国火箭军只有800辆导弹发射车,实力跟伊朗一样

美国得出结论,中国火箭军只有800辆导弹发射车,实力跟伊朗一样

凉羽亭
2026-09-06 06:56:41
男人不会无缘无故阳痿!医生:男人硬不起来,离不开这4个原因

男人不会无缘无故阳痿!医生:男人硬不起来,离不开这4个原因

医学原创故事会
2026-09-05 16:46:41
DeepSeek被曝将采购16万颗华为昇腾950DT

DeepSeek被曝将采购16万颗华为昇腾950DT

观察者网
2026-09-05 17:37:05
WTT澳门赛:男单签位出炉!国乒3人全部扎堆下半区,周启豪首轮战邱党

WTT澳门赛:男单签位出炉!国乒3人全部扎堆下半区,周启豪首轮战邱党

全言作品
2026-09-06 16:04:23
世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

小蜜情感说
2026-09-06 12:47:12
比赛还没开打,上海申花先迎来一个好消息,客场取胜重庆队更稳了

比赛还没开打,上海申花先迎来一个好消息,客场取胜重庆队更稳了

零度眼看球
2026-09-06 07:40:29
行母习惯玩剧组夫妻!黄磊投资综艺亏麻了!

行母习惯玩剧组夫妻!黄磊投资综艺亏麻了!

八卦疯叔
2026-09-06 10:20:06
意外!徐正源给辽宁铁人球迷带来久违好消息,罗慕洛下赛季入队

意外!徐正源给辽宁铁人球迷带来久违好消息,罗慕洛下赛季入队

振刚说足球
2026-09-06 10:32:04
2026-09-06 17:24:49

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

艺术
旅游
时尚
数码
公开课

艺术要闻

2026 潮涌宁波—第六届综合材料绘画展 入选作品(三)

旅游要闻

三峡旅游的进与退:新船载客率碾压同行,老景区出售价近乎腰斩

金秋最流行的鞋子,“红色”更时髦!

数码要闻

消息称苹果正在研发两款游戏手柄

公开课

李玫瑾:为什么性格比能力更重要?

×