gg2
衡量代码的草率程度
已归档 —— 这条已轮出今日牌堆,完整内容在此保留。
一句话看懂
一位Earendil 工程师提出了衡量指标,显示 AI 智能体代码大约冗长两倍且侵蚀更严重。
该文章认为,正确的代码仍可能侵蚀代码库,因此人类的品味依然重要。
背景
该文章围绕这样一个问题展开:如果编程被 AI 智能体“解决”了会怎样,以及如何判断生成的代码是否真的好。作者是 Earendil 的一名工程师,测试了多种草率程度指标,包括代码行数变化、冗长度(重复或不必要的行)以及侵蚀度(大量代码集中在少数几个庞大而复杂的函数中)。将 SlopCodeBench 评估中生成的代码与成熟代码库进行比较,智能体代码在冗长度和侵蚀度两项上的得分大约高出两倍。该文章在 Hacker News、Lobsters、Reddit 和 X 上被分享,讨论集中在为什么正确的代码仍可能侵蚀代码库,以及为什么人类的直觉和品味依然重要。
来龙去脉
- 2026年9月9日这篇博客文章《如果编程被解决了,接下来怎么办?:衡量代码的草率程度》发表在 earendil.com 上。
- 2026年9月11日该文章由 @pidotdev 在 X 上分享,称其为 Earendil 工程师 @SebastianBaye 的新博客文章,讨论为何量化代码的草率程度很困难。
- 2026年9月11日该文章被提交到 Hacker News 和 Lobsters,并在 r/theprimeagen 上引发讨论。
各方怎么说
- 作者
- 代码行数变化是一个出奇有效的草率程度指标,但具有讽刺意味的是,若以优化该指标为目标,它就会变得毫无意义。
- 作者
- 冗长度和侵蚀度能很好地区分遗留代码库与 LLM 生成的代码,智能体代码的冗长和侵蚀程度大约是人类代码的两倍。
- 社区
- 讨论围绕为什么正确的代码仍可能侵蚀代码库,以及为什么人类的直觉和品味依然重要展开。
待核实
关于冗长度和侵蚀度“能很好地区分遗留代码库与 LLM 垃圾代码”的说法,依据的是作者自己的测试和 SlopCodeBench 评估;该文章是单一来源的博客叙述,所检索到的材料没有提供独立复现或同行评审。