当前区域 04 / 08人工智能与智能系统区
大语言模型怎样把
一句话继续下去
核心问题为什么一句流畅的 AI 回答,仍然可能不是事实?
“今天出门记得带——”
先别急着往下看。你会接什么?窗外在下雨,后面很可能是“伞”;前文说要去考试,可能变成“准考证”;如果这是悬疑小说,答案甚至会完全不同。
天空越来越暗,雨点敲在窗上。今天出门记得带——
这些候选由页面预先写好,只演示“上下文改变候选”,不是任何模型的真实概率。
许多用于生成文本的 ,做的正是这种“根据现有上下文继续下去”的工作。它先估计下一个文字单位有哪些可能,选出一个,再把新结果放回上下文,继续估计下一步。几百字的回答,就这样一小步一小步长出来。
模型没有先从“标准答案仓库”里取出整段文字。它生成的是在当前上下文中很像回答的后续。
模型学过什么,和它这次看见什么
模型投入使用以前,训练过程已经根据大量样本和训练目标调整了内部参数。到了这一次对话,模型接收你提供的文字和系统给它的上下文,再生成结果。前者是训练,后者通常叫推理。
把一份课程通知贴进对话,可以让模型这一次参考它;这通常不等于重新训练模型,也不能据此保证系统以后会准确记住。
现在只记一句训练塑造模型,当前上下文影响这一次生成。
流畅是一种能力,核验是另一种工作
语言模型擅长捕捉语言里的结构:怎样接得自然,怎样把几段话组织得像一篇说明,怎样沿着示例写出相似格式。它可以很快给三个标题、重写一段拗口文字,或者把你提供的材料整理成初步提纲。这些都是有限而真实的帮助。
可是一段话语法完整、语气肯定,并不能证明它已经查询外部世界。模型可以写出很像论文的题名,却没有读过那篇论文;也可以说“日历已添加”,现实中的日历却没有发生任何变化。
这句话只是在组织语言吗?
看它是否清楚、有用、符合表达目的。
它声称外部事实或动作:去找来源、记录或责任人确认。
三个以后会再遇到的路标词
是模型处理文字时使用的离散单位;帮助模型建立序列内部的联系;说明一次推理能够直接处理的范围。
这些词帮助你继续查阅,但不需要今天全部掌握。点击术语可以看准确边界;首读主线仍只有生成、训练与核验。
做一个观察
给同一句结尾换三种前文
在纸上写三段不同的开头,都以“今天出门记得带——”结束。先让自己补完,再请一个 AI 各给三种后续。观察上下文怎样改变答案,然后圈出其中任何涉及外部事实的句子。
这个小实验不需要提交私人信息,也不判断模型“聪不聪明”。它只让生成与核验的分界第一次变得可见。