新出现
前沿模型长期代码维护能力不足,严格通过率仅 24%
Opus 5 在 SlopCodeBench 上严格通过率仅 24%,所有模型均未能完整通过任何挑战,复杂度随时间攀升。
量化评估模型维护代码库的能力,帮助判断哪些模型可放手无人值守,避免高估模型自主性。
- Benchmarking Opus 5 on SlopCodeBench Hacker News #14
2026 年 7 月 28 日 · 星期二
Opus 5 在 SlopCodeBench 上严格通过率仅 24%,所有模型均未能完整通过任何挑战,复杂度随时间攀升。
量化评估模型维护代码库的能力,帮助判断哪些模型可放手无人值守,避免高估模型自主性。
用 RL 微调 9B 开源模型,在目录审查任务上以 87.3% 评分和 0.5 美元/千条成本击败前沿模型,成本降 68 倍。
表明低成本微调开源模型可在特定工作流上替代昂贵前沿模型,改变 AI 工程成本与选型判断。
Anthropic CEO 反驳禁止开放权重模型传言,主张芯片出口管制、打击蒸馏、强制安全测试,并讨论生物攻击攻防不对称。
校准对 AI 政策走向和开放模型风险的判断,影响对开放模型安全与监管的预期。
PyTorch 被用作参考语言,LLM 生成显式前向-反向代码,通过验证器保证等价,省去手写反向。
训练栈可复用此配方,减少手写反向的调试成本,提升训练代码可靠性。
将 CI 换成 merge queue,给代理 dry-run 命令,让代理在上下文窗口内跑完测试并修 bug,避免坏代码推给团队。
为 AI 编程代理设计新的工作流,减少人工审查负担,提升 agent 开发效率。
AI 让开源从学习社区变成公共源码,星标反映算法与营销而非真实学习价值。
开发者判断开源项目价值时不能只看星标,需重新评估学习路径与社区参与方式。