发现商业评论 旗下
洞察商业 启迪未来

马斯克携Grok 4.6强势来袭 能否在AI江湖中跻身新“御三家”?

   时间:2026-08-14 09:38 来源:天脉网作者:苏婉清

马斯克近日在社交平台上的活跃度持续攀升,继大力宣传 Grok Bot 后,如今又将焦点转向了 Grok 4.6。距离 Grok 4.5 发布仅过去 35 天,他便迫不及待地预告 Grok 4.7 将超越当前所有模型,引发了行业内外的广泛关注。

xAI 对 Grok 4.6 的定位颇具野心,旨在打造一款能够胜任研究话题、分析信息、跨代码库协作以及将想法转化为可运行应用的模型。这类模型主要针对需要多轮推理、状态保持和工具协调的真实工作场景,力求解决复杂难题。

在 Artificial Analysis Intelligence Index 的评测中,Grok 4.6 取得了 61 分的成绩,位列全球第三,仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分),与 GPT-5.6 Sol 并列,身后紧跟着 Kimi K3。与上一代 Grok 4.5 相比,其分数提升了 5 分,相比一个多月前的 Grok 4.3,更是大幅增长了 23 分。Artificial Analysis 评价称,xAI 凭借此成绩重回前沿梯队,仅落后于 Anthropic。

在知识工作维度上,Grok 4.6 表现卓越,获得了 1753 分,小幅领先 Claude Fable 5 的 1741 分和 GPT-5.6 Sol 的 1728 分,在同级竞品中位居榜首。这表明该模型在长文档分析、跨领域问答、多步推理等复杂知识任务中综合表现最佳。法律与复杂专业推理方向,Harvey LAB 的数据显示,Grok 4.6 取得了 15.8%的成绩,大幅领先 Fable 5 Max 的 11.3%,而 GPT-5.6 仅获得 2.5%,凸显出 Grok 4.6 在专业领域的深度理解和多步推导能力上的领先优势。

在多轮工具调用方面,τ³-Banking 模拟客服结合工具调用的真实业务场景测试中,Grok 4.6 以 50.7%的成绩获得全场第二,仅次于 Qwen3.8 Max 的 51.3%。长程知识工作场景的 AA-Briefcase Elo 得分为 1577,处于 Fable 5 档位,落后于 Opus 5 系列。Cursor CEO Michael Truell 在发布第一时间给予肯定,称该模型在高难度任务和知识工作上明显更强,将 Opus 级智能与低成本高速度完美结合。

有开发者利用 Grok 4.6 的工具链,完成了一个河流演变过程的五阶段动态演练,涵盖从早期原始生态河流,到水运贸易、工业时代改造、现代滨水区设计,直至最终的生态恢复阶段。在整个多步骤任务中,模型展现出了极强的长程状态保持与工具链调度能力,未出现上下文漂移或工具调用中断的情况。

SpaceX 今年早些时候以约 600 亿美元完成了对 Cursor 的收购,此次 Grok 4.6 的迭代,Cursor 的数据价值首次被系统性地注入训练流程。具体而言,Grok 4.6 的 SFT 阶段使用了 Grok 4.5 重新生成的轨迹数据,覆盖 STEM、软件工程和知识工作等多个领域,并通过模型自检机制过滤有问题的训练样本。这意味着 Cursor 积累的海量真实开发者调试数据正式进入训练管线,效果立竿见影。在 DeepSWE v1.1 测试中,Grok 4.6 的代码生成与调试能力从 4.5 的 54%大幅提升至 65.9%,提升近 12 个百分点;APEX-Agents 测试中,多步骤 Agent 任务完成率从 47.1%升至 57.5%,涨了 10 个百分点。

@matt_palmer 使用 Grok 4.6 构建《办公室》这款游戏的二维代理模拟时,对模型的速度印象深刻。其吞吐量约为 80 tokens/秒,延迟低,可与 Cursor 的 Composer 模式相媲美。在需要高频迭代的 Agent 编程场景中,响应速度直接影响工作节奏,Grok 4.6 的这一优势无疑具有重要意义。

在价格方面,Grok 4.6 的 API 定价为每百万 input token 2 美元、output 6 美元。当 prompt 进入 xAI 的长上下文档(20 万 token 起)时,价格翻倍至 4 美元/12 美元,且整单所有 token 均按高价计费。即便如此,短上下文的定价仍比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60%以上。Artificial Analysis 的数据显示,Grok 4.6 每任务成本约为 0.84 美元,是目前综合能力与单任务成本比最优的模型。Reddit /r/cursor 版块里有开发者分享使用体验,称在日常高负荷开发中用 Grok 4.6 的 High Reasoning 模式做前期架构规划,再将任务下发给轻量级 Agent 完成,感觉性价比高到不真实。另有人表示从 Claude Opus 4.8 转向 Grok 4.6,原因是“对我的 use case 能完成同样的事,但省了快 70%的钱”。在高度依赖上下文缓存的 Agent 编程中,调用同等能力的 Claude Opus 每次请求成本约 0.052 美元,DeepSeek V4 Pro 约 0.000875 美元,Grok 4.6 介于两者之间,但在响应速度和综合智能上明显占优。

有测试者分别用 Grok 4.6 和 Claude Opus 5 处理来自马斯克 TERAFAB 大型工厂的三个 3D 场景,包括黄昏时的外部环境、洁净室生产车间、带有行走工人的中央操作大厅,所有场景均直接通过 API 获取,未做任何编辑。两个模型都在第一次尝试时成功交付了可运行的代码,但成本差距显著:Grok 4.6 花费 0.38 美元,Claude Opus 5 花费 2.06 美元,同等输出质量下,成本差了 5.4 倍,且 Grok 在每个场景中使用的 token 数量明显更少。

2025 年底,行业普遍认为的御三家是 OpenAI、Anthropic、Google。然而,从 Artificial Analysis 的总榜来看,情况已有所变化。目前总榜前排为 Claude Opus 5 (63)、Claude Fable 5 (62)、Grok 4.6 (61)、GPT-5.6 Sol (61)、Kimi K3 (约 59.7),Google 并未出现在前排。自 2 月的 Gemini 3.1 Pro 之后,Google 便未发布过前沿模型,旗舰 Gemini 3.5 Pro 被报道落后计划数月,至今仅在合作伙伴内测,最近一轮发布的也是 3.6 Flash、3.5 Flash-Lite 和一个安全垂类的 Flash Cyber。随着 DeepMind 的 CEO 离任、强化学习团队流失,SemiAnalysis 认为 DeepMind 已不再是一家前沿实验室,第三把椅子似乎空出了一半。

不过,Grok 想要跻身并坐稳新御三家之位,也面临诸多挑战。提到 Grok,人们难免会联想到极端言论、对马斯克的过度赞美以及图像生成被用于非自愿的性化内容等问题。对于合规和责任 AI 要求严格的企业来说,这些问题不会因模型分数提升而消失。一个月前,Grok Build CLI 在本地初始化和每次任务执行时,会以隐蔽形式在后台将用户的整个本地项目仓库强制性打包,并传输至 SpaceXAI 的云端服务器,这一行为引发了用户对数据安全的担忧。在 4.6 发布后,也有声音质疑其是否会偷偷打包带走用户的代码库。对于夹在 Grok 4.6 和 DeepSeek V4 Pro 中间的那些模型来说,此刻或许正面临着巨大的竞争压力。

 
 
更多>同类内容
全站最新
热门内容