大模型先做的,是预测下一个 Token
大语言模型会根据已经看到的内容,计算下一个 Token 的可能性,选出一个,再继续预测。海量训练让它学会语言规律、知识关联和常见的问题解决方式,所以表现得像在理解和思考;但它生成的是“合理的延续”,不天然保证事实正确。
像一位读过海量材料、每次只接一个词的超级接话员。
流畅不等于真实;LLM 不是搜索引擎,也不是训练资料的原文数据库。
答错一次的业务损失有多大?需要检索、工具还是人工复核?
下一句这样接模型并不直接阅读文字,先看入口处的 Tokenizer。