Skip to content
Mo's Blog
Go back

大模型思考的快与慢

llm, test-time-compute, reasoning, ai-agent

Scaling law 指的是随着模型参数量、训练数据量与算力投入的增加,模型的智能基准也会不断变强 1。在最开始我们讨论 scaling law 的时候,通常包含了一层隐含的语义:在训练时投入更多的算力。 而现在的 researcher 们发现,在推理时付诸更多努力(test-time compute2),也是让 agent 在复杂任务上取得更好效果的一个手段。这个理念甚至有那么一些仿生学的味道,经济学下尼尔·卡尼曼在《思考,快与慢》中提出人类有两种思考模式:快思考-直觉与慢思考-理性。

时至今日,慢思考的具体任务变得更系统化,大致可以分成下面几类工作

慢思考对应到具体产品上,一般是所谓的Deep Search(Codex和Gemini都有对应的模式)。以后遇到复杂的问题,就不妨给大模型一张草稿纸,让它慢下来好好思考思考。

延伸资料:

Footnotes

  1. Scaling Laws for Neural Language Models

  2. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters 2

  3. Self-Consistency Improves Chain of Thought Reasoning in Language Models — Wang et al. (2022)

  4. Training Verifiers to Solve Math Word Problems — Cobbe et al. (2021)

  5. Tree of Thoughts: Deliberate Problem Solving with Large Language Models — Yao et al. (2023)

  6. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models — Wei et al. (2022)

  7. s1: Simple Test-Time Scaling — Muennighoff et al. (2025)

  8. Self-Refine: Iterative Refinement with Self-Feedback — Madaan et al. (2023)

  9. Reflexion: Language Agents with Verbal Reinforcement Learning — Shinn et al. (2023)

  10. ReAct: Synergizing Reasoning and Acting in Language Models — Yao et al. (2023)

  11. Test-Time Training with Self-Supervision for Generalization under Distribution Shifts — Sun et al. (2019)

  12. Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation — Manvi et al. (2024)


Share this post on:

Previous Post
Amazon Lightsail 实例服务异常诊断
Next Post
Ollama的离谱bug