gzip能成为语言模型吗?
一句话看懂
Nathan Barry展示了gzip能够生成类似莎士比亚风格的文本,前提是在语料库上进行预训练。
该演示测试了压缩与预测是否是一枚硬币的两面。
来龙去脉
- 2026年6月14日Nathan Barry发表了《gzip能成为语言模型吗?》,描述了gzipt——它用语料库对gzip/zlib进行预训练,并通过寻找压缩效果最佳的字节序列来续写提示。
- 2026年9月18日一篇题为《基于压缩的机器学习导论》的论文发表,形式化了任何无损压缩器(如gzip)如何通过归一化压缩距离或最小描述长度成为机器学习方法。
- 2026年9月22日相关报道在LavX News、Unknown Observer、Hacker News、Reddit和Threads上传播,讨论了gzip的能力与局限。