← 返回日报
精读 预计 13 分钟

GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

摘要

作者更新了 GPT-5.6(Sol/Terra/Luna 三档)、Grok 4.5、Claude Opus 4.8/Fable 5、Muse Spark 1.1 及开源 Qwen 3.7 Plus、DeepSeek V4 Pro、Kimi K2.6、GLM-5.2 等 12 模型测试。四个任务:Doom 风格射线投射迷宫(WASD 行走 + 碰撞)、3D 魔方(Scramble + Solve 动画)、计算器(运算符优先级与样式)、Conway Game of Life(网格模拟)。每任务给出 5 次尝试中最佳 1 次的成功率、成本与耗时表,并附上所有原生代码链接供读者运行。额外附短提示延迟测试与 1-shot SVG 画马/太空人/火箭着陆场景对比。

荐读理由

实际五次尝试的 raycaster 和 Rubik's cube 结果显示,GPT-5.6 Sol 在复杂新颖任务上领先,Grok 4.5 在部分任务达到 Opus 水平且成本更低,开放权重模型在 Game of Life 这类有例程的任务上能以极低成本打平但在其他任务仍明显落后,这直接帮你判断项目里该用哪个模型执行代码生成

Hacker News · 104 赞 · 58 评 讨论 → 阅读原文 →

这条对你有帮助吗?