gg2
earendil.com

衡量代码的草率程度

已归档 —— 这条已轮出今日牌堆,完整内容在此保留。

一句话看懂

一位Earendil 工程师提出了衡量指标,显示 AI 智能体代码大约冗长两倍且侵蚀更严重。
该文章认为,正确的代码仍可能侵蚀代码库,因此人类的品味依然重要。

背景

该文章围绕这样一个问题展开:如果编程被 AI 智能体“解决”了会怎样,以及如何判断生成的代码是否真的好。作者是 Earendil 的一名工程师,测试了多种草率程度指标,包括代码行数变化、冗长度(重复或不必要的行)以及侵蚀度(大量代码集中在少数几个庞大而复杂的函数中)。将 SlopCodeBench 评估中生成的代码与成熟代码库进行比较,智能体代码在冗长度和侵蚀度两项上的得分大约高出两倍。该文章在 Hacker News、Lobsters、Reddit 和 X 上被分享,讨论集中在为什么正确的代码仍可能侵蚀代码库,以及为什么人类的直觉和品味依然重要。

来龙去脉

  1. 2026年9月9日这篇博客文章《如果编程被解决了,接下来怎么办?:衡量代码的草率程度》发表在 earendil.com 上。
  2. 2026年9月11日该文章由 @pidotdev 在 X 上分享,称其为 Earendil 工程师 @SebastianBaye 的新博客文章,讨论为何量化代码的草率程度很困难。
  3. 2026年9月11日该文章被提交到 Hacker News 和 Lobsters,并在 r/theprimeagen 上引发讨论。

各方怎么说

作者
代码行数变化是一个出奇有效的草率程度指标,但具有讽刺意味的是,若以优化该指标为目标,它就会变得毫无意义。
作者
冗长度和侵蚀度能很好地区分遗留代码库与 LLM 生成的代码,智能体代码的冗长和侵蚀程度大约是人类代码的两倍。
社区
讨论围绕为什么正确的代码仍可能侵蚀代码库,以及为什么人类的直觉和品味依然重要展开。

待核实

关于冗长度和侵蚀度“能很好地区分遗留代码库与 LLM 垃圾代码”的说法,依据的是作者自己的测试和 SlopCodeBench 评估;该文章是单一来源的博客叙述,所检索到的材料没有提供独立复现或同行评审。

来源

打开 App 看今天的解读 gg2 —— App Store 免费下载