Grok 4.3相比旧版本:核心能力有哪些提升
前言:是否值得重新评估Grok 4.3?
开发者对Grok的长期印象并不理想,普遍认为它便宜却不够可靠。4.3更新后,xAI表示代码能力与上下文处理均有明显进步。真正需要验证的是:提升幅度究竟多大,以往的问题是否修复,以及现在是否值得重新评估。
工具数量太多而难以选择、收藏不少但真正使用的很少、查找成本高、入口分散、缺乏开发者向整理——在评估模型升级时,这五种困扰尤其现实。若想按场景快速比较AI工具的版本表现,可以了解 titiai.cn 这类AI工具聚合平台。
今天以相同的一组测试任务比较Grok旧版本和4.3,从实际表现差异中找出开发者能够切身感知的变化。
一、从六个维度比较版本变化
| 维度 | 旧版本 | 4.3 | 变化 | 体感 |
|---|---|---|---|---|
| 代码生成 | 5.8 | 6.9 | +1.1 | 非常明显 |
| 算法实现 | 6.5 | 7.8 | +1.3 | 非常明显 |
| 上下文窗口 | ~8万 | ~12.8万 | +60% | 明显 |
| 响应延迟 | 1.2秒 | 0.8秒 | -33% | 明确 |
| Bug修复 | 4.8 | 6.3 | +1.5 | 明显 |
| 文档生成 | 6.2 | 7.0 | +0.8 | 明显 |
提升幅度最大的项目是代码生成(+1.1分),其后是算法实现(+1.3分)。响应延迟则由1.2秒缩短至0.8秒,提升幅度达到33%。
二、体感最突出的改变:代码能力显著跃升
旧版Grok编写的代码基本无法使用,可直接运行率仅为 48%,生成结果经常存在语法或逻辑错误。到了4.3,这项数字被提升至 62%,尽管与GPT-5.6(89%)仍有距离,但它在四款模型中的进步幅度最大。
| 指标 | 旧版本 | 4.3 | 变化 |
|---|---|---|---|
| 可直接运行率 | 48% | 62% | +14% |
| 代码规范性 | 5.2/10 | 6.5/10 | +1.3 |
| 边界条件处理 | 35% | 52% | +17% |
| 异常处理覆盖 | 28% | 45% | +17% |
提升最显著的是边界条件处理与异常处理覆盖(各+17%),表明4.3对于代码不仅需要运行,还必须保持健壮这一要求有了更深入的理解。
算法实现成为4.3出人意料的亮点,LRU缓存实现获得 7.8/10,与Gemini(7.2)接近;相较旧版本的6.5,成绩提高了1.3分。4.3提供的算法方案更精简,对边界情况的处理也更全面。
三、体感清晰的改变:更大的上下文窗口与更快的响应
上下文窗口由约8万增至12.8万token,扩展幅度为60%。
因此,4.3单次可处理约3500行代码,较旧版本约2200行增加了 60%。分析中等规模代码时,原来需要分两次输入的内容,现在一次即可完成。
不过,12.8万token仍比Gemini(100万)少87%,也比Claude(20万)少36%,处理大型项目时依旧要分块。
响应延迟由1.2秒缩短到0.8秒,提升幅度为33%。
对于代码补全、即时问答等实时交互任务,这种进步能够明显感知,0.8秒已经接近无感延迟的门槛。对比来看,Gemini约0.65秒,速度最快;GPT-5.6约1.2秒,Claude同样约1.2秒。
四、提升幅度有限的维度
Bug修复:成绩从4.8升至6.3(+1.5),虽然有所提高,在四款模型里仍然最低。GPT-5.6达到8.8,Claude为8.2。4.3可以识别更多Bug,但发现异步竞态、隐式类型转换等隐蔽问题的能力依然较弱。
文档生成:由6.2提高至7.0(+0.8),质量虽有进步,与Claude(8.6)相比仍有明显距离。4.3产出的文档较为中规中矩,缺少Claude那种接近真人写作的质感。
函数调用:成绩从5.2增至6.1(+0.9),有所进步却仍是四款模型中最弱的。可选参数触发率由40%提高至45%,并行调用成功率从42%增至52%;整体改善有限,工程集成时的问题依然存在。
五、哪些旧问题至今仍未解决?
① 代码审查的误报率依旧较高
旧版的误报率约为50%,4.3已经降低至 43.3%,虽有改善,仍是四款模型中最高的(GPT-5.6 21.2%、Claude 18.8%)。因此,依旧不建议将其直接接入CI执行代码审查。
② 多轮对话的一致性仍然不足
旧版本的10轮一致性约为45%,4.3提高到 58%,改善了13个百分点,但与Claude(90%)之间依然相差巨大,因此仍不适合长对话场景。
③ 多模态能力基本没有进步
旧版的多模态能力较弱(综合约5.0),4.3约为 5.4,改进幅度几乎可以忽略。Grok依旧不擅长图片理解、PDF解析和视频处理。
六、当前四款模型的综合比较
| 维度 | Grok 4.3 | GPT-5.6 | Claude 4.8 | Gemini 3.5 |
|---|---|---|---|---|
| 代码生成 | 6.9 | 8.5 | 8.3 | 7.2 |
| 文档生成 | 7.0 | 8.3 | 8.6 | 7.8 |
| Bug修复 | 6.3 | 8.8 | 8.2 | 7.0 |
| 响应速度 | 0.8秒 | 1.2秒 | 1.2秒 | 0.65秒 |
| API成本 | 最低 | 中等 | 最高 | 有免费额度 |
| 综合 | 6.9 | 8.5 | 8.3 | 7.2 |
4.3综合取得6.9分,已从完全不可用提升为足以应付简单任务。不过,它与GPT-5.6(8.5)及Claude(8.3)之间仍有明显差距。
总结
Grok 4.3相比旧版本,提升最明显的是代码能力(+1.1分、可直接运行率+14%)和响应速度(-33%),上下文窗口也扩大了60%。算法实现(7.8分)是意外亮点,接近Gemini水平。但代码审查误报率(43.3%)、多轮对话一致性(58%)、多模态能力(5.4)仍然是短板。4.3的定位从"完全不能用"升级到了"简单任务的低成本方案"——适合个人项目、原型验证、轻量级任务,关键环节仍然需要GPT-5.6或Claude兜底。
-
07.29
AI明星加速出道
-
07.29
35 名大学生 32 人考试作弊,教授用一行"隐形指令"让AI露出破绽
-
07.29
AI安全细分赛道拐点已到
-
07.29
马斯克全面向ASI让步,10年后万亿财富都将“归0”
-
07.29
宁德时代的第三增长曲线,少不了 AI
-
07.29
AI影视该走出嘴炮时代了
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏