谷歌、OpenAI学者谈AI：语言模型正在努力「攻克」数学

如果问计算机擅长什么，在所有的答案里，数学必须榜上有名。在经历了漫长的研究之后，顶尖学者们在研究计算机关于数学计算方面的发展，取得了令人惊讶的成绩。

就拿去年来说，来自加州大学伯克利分校、OpenAI 和 Google 的研究人员在语言模型方面取得了长足的进步，GPT-3、DALL·E 2 等被开发出来。然而，直到现在，语言模型还无法解决一些简单的、用语言描述的数学问题，例如「Alice 比 Bob 多五个球，Bob 在给 Charlie 四个球后有两个球。问 Alice 有几个球？」这对语言模型来说，想要给出正确答案，可能就有点「吃力」了。

「当我们说计算机非常擅长数学时，意思是它们非常擅长特定的、具体的事情，」来自谷歌的机器学习专家 Guy Gur-Ari 表示。计算机擅长算术是不假，但在特定的模式之外，计算机就无能为力了，简单的文字描述题都回答不了。

谷歌研究员 Ethan Dyer 曾经表示：做数学研究的人有一套僵化的推理系统，对于他们熟知的和不了解的内容，这两者之间有着明显的鸿沟。

解决文字问题或定量推理问题很棘手，因为不同于其他问题，这两者需要鲁棒性和严谨性。如果过程中的任何一步出现错误，将会导致错误的答案。DALL·E 在绘画方面令人印象深刻，尽管它生成的图像有时会很奇怪，可能遗漏人的手指、眼睛长得奇怪…… 这些我们都能接受，但是它在数学方面出现了错误，我们的容忍度就会非常小。来自 OpenAI 的机器学习专家 Vineet Kosaraju 也曾表达过这种想法，「我们对语言模型所犯的数学错误（比如将 10 误解为 1 和 0，而不是 10）容忍性还是比较小的。」

「我们研究数学仅仅是因为我们发现它独立且非常有趣，」OpenAI 机器学习专家 Karl Cobbe 说。

随着机器学习模型在更大的数据样本上训练而成，它们的鲁棒性更好、出错也更少。但扩大模型规模似乎只能通过定量推理进行。研究人员意识到，对于语言模型所犯的错误似乎需要更有针对性的方法来解决。

去年，加州大学伯克利分校和 OpenAI 的两个研究团队分别发布了数据集 MATH 和 GSM8K，这两个数据集包含几何、代数、初等数学等数千个数学问题。「我们想看看这是否是数据集的问题，」从事数学工作的 AI 安全中心研究员 Steven Basart 说。众所周知，语言模型不擅长单词问题，在这个问题上它们表现的有多糟糕，是否可以通过引入格式更好、更大的数据集来解决？

在 MATH 数据集上，顶级语言模型的准确率为 7%，而人类研究生的准确率为 40%，奥林匹克冠军的准确率为 90%。在 GSM8K 数据集上（小学级别的问题），模型达到了 20% 的准确率。实验中 OpenAI 使用了微调和验证这两种技术，结果表明模型可以看到很多自身错误的例子，这一发现很有价值。

当时，OpenAI 的模型需要在 100 倍以上的数据上进行训练，才能在 GSM8K 上达到 80% 的准确率。但在今年 6 月，谷歌发布了 Minerva，达到 78% 的准确率。这一结果超出了预期，研究者表示，比预想的时间来的更快。

论文地址：https://arxiv.org/pdf/2206.14858.pdf

Minerva 基于谷歌自研的 Pathways 语言模型 (PaLM)，具有更多的数学数据集，包含 arXiv、 LaTeX 等数学格式。Minerva 还采用了其他策略，在思维链提示（chain-of-thought prompting）中，Minerva 将更大的问题分解成小块。此外，Minerva 还使用多数投票（majority voting），不是要求模型给出一个答案，而是要求它提出 100 种答案。在这些答案中，Minerva 选择最常见的一种答案。

这些新策略的收益是巨大的，Minerva 在 MATH 上的准确率高达 50%，在 GSM8K 以及 MMLU（包括化学和生物学在内的一组更通用的 STEM 问题）上的准确率接近 80%。当 Minerva 被要求重做稍微调整过的问题时，它的表现同样很好，这表明它的能力不仅仅是来自记忆。

Minerva 可能有奇怪、混乱的推理，但仍然得出正确的答案。尽管像 Minerva 这样的模型可能会得出与人类相同的答案，但它们所遵循的实际过程可能大不相同。

谷歌机器学习专家 Ethan Dyer 表示，「我认为存在这样一种观念，即数学相关人士有一些严格的推理系统，了解某事和不了解某事之间存在明显的区别。」但人们给出的答案不一致，会犯错误，也无法应用核心概念。在机器学习前沿中，边界是模糊的。

原文链接：https://spectrum.ieee.org/large-language-models-math

理论语言模型数学OpenAI谷歌

相关数据

机器学习技术

机器学习是人工智能的一个分支，是一门多领域交叉学科，涉及概率论、统计学、逼近论、凸分析、计算复杂性理论等多门学科。机器学习理论主要是设计和分析一些让计算机可以自动“学习”的算法。因为学习算法中涉及了大量的统计学理论，机器学习与推断统计学联系尤为密切，也被称为统计学习理论。算法设计方面，机器学习理论关注可以实现的，行之有效的学习算法。

来源：Mitchell, T. (1997). Machine Learning. McGraw Hill.

定量推理技术

定量推理（QR）是指将基础数学技能（如代数）用于在学科或跨学科问题背景下分析和解释现实世界的量化信息。

来源：aacu.org

准确率技术

分类模型的正确预测所占的比例。在多类别分类中，准确率的定义为：正确的预测数/样本总数。在二元分类中，准确率的定义为：(真正例数+真负例数)/样本总数

来源：Google ML Glossary

语言模型技术

语言模型经常使用在许多自然语言处理方面的应用，如语音识别，机器翻译，词性标注，句法分析和资讯检索。由于字词与句子都是任意组合的长度，因此在训练过的语言模型中会出现未曾出现的字串(资料稀疏的问题)，也使得在语料库中估算字串的机率变得很困难，这也是要使用近似的平滑n元语法(N-gram)模型之原因。

来源：维基百科

算术技术

算术（英语：arithmetic）是数学最古老且最简单的一个分支，几乎被每个人使用着，从日常生活上简单的算数到高深的科学及工商业计算都会用到。一般而言，算术这一词指的是记录数字某些运算基本性质的数学分支。