AI 入门
生成式 AI 基础
解释生成式 AI 的基本机制,以及它在实践中的能力、局限和风险。
来源链接:https://aipedagogy.org/guide/foundations-of-generative-ai/
像“非常强大的自动补全”
“生成式 AI”指能够生成新内容的工具,通常生成文本或图像;“大语言模型”则是生成式 AI 模型中的一种具体类型。
理解大语言模型的一种方式,是把它想象成一种极其强大的自动补全。简单的自动补全会读取你刚刚输入的最后一个词,查找一个表格,找出最可能跟在它后面的词,然后给出一些建议。在这样的工具中,这个表格可能是通过分析大量文本、统计每个词跟在其他词后面出现的次数,并计算概率而生成的。
类似地,为 ChatGPT 提供支持的 GPT-5.4 等大语言模型,会分析输入文本,然后根据此前已经出现的词,预测下一个可能出现的词,并把这个词加入字符串。这个过程会一个词接一个词地持续进行,直到生成一个完整回应。
大语言模型与简单自动补全的差异
不过,大语言模型与简单自动补全之间有一些重要差异。
训练数据集的规模
这些工具背后的模型,会根据预先选定的一组文本集合中的数十亿词语所呈现出的模式,生成关于下一个词的概率。这个文本集合被称为训练数据。
判断下一个词的复杂性
大语言模型并不是简单查阅一个概率表。OpenAI 的 GPT-5.4 等大语言模型,会先使用由训练数据确定的大量参数进行数十亿次计算,把最初的提示词转换成关于下一个词可能是什么的预测。这些模型常被称为“神经网络”;相关定义可参见“术语表”。
它们还会分析句子的语义结构,而这一点也会进入模型计算。
训练过程中对人的依赖
如果没有适当的防护措施,大语言模型倾向于生成有害内容。为了让这些工具提供礼貌且安全的回应,它们会经历一个被称为“基于人类反馈的强化学习”的过程。
这个过程需要人工工作者手动审查 AI 生成内容并提供反馈,随后这些反馈会被用于进一步微调模型。值得注意的是,许多总部位于美国、估值数十亿美元的科技公司会使用国际合同工;这些工作者可能接触到创伤性内容,却只获得较低报酬和有限的心理健康支持。原站在此处引用了报道 “OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic.”
大语言模型的欺骗性
大语言模型具有欺骗性,因为它们看起来像是在理解、思考和推理。但事实上,它们并没有做这些事。
它们被设计成模仿人类,但它们并不是活的存在,没有主观经验,即使它们会使用“我”这个词,也不能思考或感受。
如果想更深入但仍然易懂地理解这些工具如何工作,原站推荐阅读入门文章 “Large language models, explained with a minimum of math and jargon.”
图像生成与其他生成式 AI 工具
DALL-E、Midjourney 和 Stable Diffusion 等图像生成工具,在底层工作方式上与大语言模型有相似之处。不过,对于这些工具而言,还存在从文本到图像的额外转换层级。
图像生成工具的影响非常深远,涉及版权、所有权,以及用于改进模型的人类劳动等问题。关于生成式图像工具及其影响,原站推荐 Eryk Salvaggio 的 Critical Topics: AI Images,其中包含录制讲座和许多有用链接。
此外,还有用于生成视频、编写代码、创作音乐等更多类型的生成式 AI 工具。
对话式聊天机器人的能力、局限与担忧
以下图表来自 Jisc National Centre for AI,概述了 ChatGPT 和其他对话式聊天机器人周围的一些关键能力、局限与担忧。为清晰起见,原站对文字做了少量调整。
| 能力 | 局限 | 担忧 |
|---|---|---|
| 它可以围绕任何主题写出听起来合理的文本。 | 它可能生成看似合理但实际错误的信息。 | 它可能并且确实会生成带有偏见的输出,包括文化、政治等方面的偏见。 |
| 它可以回答一系列问题,包括编程、数学类问题和多项选择题。 | 答案可能由模型自身生成,也可能由工具搜索互联网后生成。当答案主要来自模型自身时,其底层训练数据可能存在截止日期。 | 它可能生成不可接受的输出。 |
| 随着每次发布,它变得越来越准确和复杂。 | 对其回应中信息来源的解释能力有限;这一点在不同聊天机器人之间会有所不同。 | 它具有较高环境影响,也引发关于人类影响和训练材料所有权的担忧。 |
| 每次使用时,它都会生成独特文本。 | 用户数据被用于训练模型的方式会带来安全与隐私担忧。 | |
| 它非常适合文本摘要等其他任务。 | 存在数字不平等的风险。 |
