像人一样思考
关注机器是否能模拟人的认知过程
例如:比较程序与人解决同一问题时的推理步骤是否相似或一致
从历史概览到现实应用
人工智能会成为控制环境、信息与人类经验的系统吗

当系统能够塑造我们看到的信息,它是否已经在影响我们的判断?
把智能、意识、情感表现和心理操纵放进同一个测试

能够让人相信它理解,并不等于它真的以人的方式理解
三部典型作品:是否服从、身份认同、道德伦理



人工智能怎样服从人?是否可能成为人?如何被人对待?
完成本讲后,你应该能够
往往是工作流中的一个能力节点
依赖个人经验,步骤和标准尚未明确归纳
用明确语言,表达输入、行动和预期结果
在关键节点设置检查方法与验收标准
让同类任务可以重复执行;并持续改进

有效使用人工智能的起点,是理解如何组织任务
AI 的定义一直在变,持续把抽象问题转成可设计的系统行为

I propose to consider the question, “Can machines think?”
Alan Turing, Computing Machinery and Intelligence, 1950
The study of agents that receive percepts from the environment and perform actions
Stuart Russell and Peter Norvig, Artificial Intelligence: A Modern Approach
不同的目标会改变定义、实现路线、以及评价标准
关注机器是否能模拟人的认知过程
例如:比较程序与人解决同一问题时的推理步骤是否相似或一致
关注机器的外部表现能否与人相似
例如:图灵测试通过单盲方式观察人是否能通过回应区分机器和人
关注推理过程是否符合逻辑规则
例如:逻辑程序根据前提推出的结论是否是全局最优
关注系统能否在环境中选择有效行动
例如:自动驾驶汽车是否能在约束条件下选择安全行动
它检验行为上能否区分人机,但并不能证明机器具有意识或有理解能力

行为相似是可观测标准,意识和理解则更深——人自己还没搞明白
现实问题不在乎专业边界,AI 在多种思想和技术的交叉处形成
哲学追问意识、智能、认识与知识,数学把推理转化为计算和形式结构
经济学研究有限条件下的最优选择,控制论研究行动后反馈调节
参考神经科学的生物机制研究,和心理学对认知、学习与行为的研究
计算机工程提供实现条件,语言学解释结构与意义
AI 研究吸收其他学科的方法和成果,也影响这些学科的方向和工具
智能是什么?哪些智能形式可以被形式化?
追问心智、知识、理性、认识、真实,以及机器能否思考
把逻辑、可计算性、概率和不确定性转化为形式工具


如何做出最优选择?行动和反馈之间如何连接与调整?
研究有限信息、有限资源、偏好和博弈条件下如何做出最优选择
研究系统如何围绕目标行动,并根据反馈持续调整


智能的生物学机制是什么?认知、意识、学习、情绪、行为是如何发生的?
研究神经元、连接和脑区如何共同支持智能活动
研究感知、记忆、学习的机制,以及问题解决如何影响行为


实现机器智能的物质基础是什么?语言如何承载结构与意义?
提供计算架构、存储、传感器和持续增长的算力
解释语法、语义和语用如何组织语言与知识


每一轮突破都需要能力、条件和边界的协同
这一阶段解决了此前难以处理的什么问题,让哪些传统能力变得不再必要
例如:GPT-3 之后,自然语言成为处理多类任务的通用接口,绘图、编程等任务所需前置练习迅速变少
数据、算力、算法、知识和工程发生了什么变化
例如:互联网发展带来的 UGC 大规模数据、显卡技术带来的并行算力和创新性的 Transformer 架构共同支撑能力扩展
成功进入真实任务后,又暴露了哪些局限,有哪些过于乐观
例如:大语言模型的幻觉、预训练模型的时效、基于大语言模型的工具可靠性和责任问题,进入实际工作时变得尤为突出
计算机出现以后,智能开始逐渐被拆成表示、学习、测试和求解

人工神经元模型模拟真实神经元,把神经活动转成可计算模型
梯度下降、反向传播算法导致连接变化,可以解释经验如何改变系统
图灵极大地简化了问题,把机器智能转化为可观察的行为
程序开始尝试搜索和证明此前只能由人来完成的问题
达特茅斯会议提出,用机器模拟学习、语言、抽象和问题求解
“人工智能”成为一个研究领域
学习、语言、抽象和问题求解进入同一研究议程
受限问题中的快速进展被推向更通用的能力预期
形式推理与程序设计语言
神经网络与机器智能
信息论与博弈程序
启发式搜索与符号问题求解
早期 AI 沿着形式化、搜索和领域知识逐步展开
搜索、推理和积木世界推动第一次 AI浪潮
实际能力与承诺的落差带来第一次 AI 寒冬
专家系统把领域知识写入可运行规则,转向边界清楚的专业任务
知识获取、维护和隐性经验成为新的瓶颈

数据、算力和反馈机制改变了知识与能力的获得方式
神经网络复兴,机器学习走向数据评估
行为主义机器人强调环境、行动和反馈
海量数据、基准任务和基础设施逐渐成熟
深度学习提升多媒体和和文本的处理能力
大语言模型带来了新一轮 AI 爆发

虽然各自强调的对象不同,但现在经常共同出现和协作
把知识写成符号、规则和逻辑关系
探索路线:把理性活动还原为可以表达和推演的形式结构
让系统通过数据调整连接并形成表示
探索路线:让能力从大量样本和连接调整中逐渐形成
让系统在环境中行动并根据反馈改进
探索路线:通过感知、行动和反馈形成适应环境的能力
符号、连接与行动,是人类探索机器智能的三大基本方向
系统的能力来自预先编码的知识表示和推理规则

把事实、概念和关系转化为机器可以处理的符号结构
按照明确的显式规则,从已知条件推出结论
常识、惯例、例外、隐性经验等等难以全部写成规则
可表达的知识边界就是系统的能力边界——有没有想起维特根斯坦?
把推理、规划和语言任务转化为符号操作与搜索
在候选路径中寻找可以达到目标的步骤
代表成果:通用问题求解器 General Problem Solver
按照逻辑规则从已知条件推出结论
代表成果:能够证明数学定理的 Logic Theorist
在积木世界等受限环境中整合语言、规划和行动
代表成果:能够理解指令并操作积木的 SHRDLU
符号主义把智能活动理解为可以用符号表示、依规则推演的形式系统
难以扩展到真实环境,研究投入随预期下降而下降
系统只能处理设计者预先定义的问题
SHRDLU 在积木世界表现出色,离开预设对象便难以工作
知识、数据、算力和工程能力无法支撑通用的人工智能设想
早期神经网络缺少足够数据与算力,难以扩展到真实感知任务
局部成功被解释为接近人类的普遍智能
机器翻译的早期演示被推向通用翻译预期,实际质量远远没有达到预期目标
Demo 只能证明一个任务,不能自动证明通用能力——一贯如此
研究重心从通用求解,转向边界清楚的专业任务
MYCIN 把细菌感染与抗生素选择知识写成领域规则
MYCIN 根据症状和检验结果匹配规则,推导诊断建议
XCON 只为 DEC 的 VAX 计算机生成配置方案,任务边界明确
专家系统的规则推理与管理信息系统结合,诞生了决策支持系统
专家系统的能力取决于人能否持续表达、编码和维护知识
“我们知道的总比能够说出的更多”
Michael Polanyi,《隐性维度》,1966
专家访谈和规则整理需要大量时间以及一定程度的专业能力
直觉、语境和例外难以全部写成规则;而这些往往是最重要的
环境变化或规则遗漏会让结论失效,这在商业环境中是致命的
今天的大语言模型和生成式人工智能依然依赖可显性化的数据与知识
符号关系依然在现代系统中承担结构化表达和连接作用

新方法并不总是完全淘汰旧方法,更多时候是在不同环节重新组合
研究者开始用数据集、指标和盲测比较系统在新样本上的表现

从样本中估计规律和不确定性
用统一任务比较不同方法
系统能否处理训练数据之外的新样本
早期 Google 翻译从大规模语料中的统计规律出发,有效提升了翻译准确率
通过训练调整连接权重,并从数据中逐渐形成表示
“我们所知最好的学习机器是人脑”
Geoffrey Hinton,多伦多大学访谈
知识分布在连接权重中,训练过程决定系统形成什么表示——用于训练的数据非常重要——Garbage in, garbage out,微软对此深有体会
机器学习从样本和反馈中自动调整模型
“机器学习研究的是能够通过经验自动改进的计算机算法”
Tom Mitchell,《机器学习》,1997
机器学习把一部分规则从人工编写转移到数据、目标和训练过程
系统获得的答案、结构或奖励不同,学习任务也不同
“与其编写模拟成人心智的程序,何不尝试模拟儿童的心智?”
Alan Turing,《计算机器与智能》,1950
样本同时提供输入和目标答案
根据带标签的历史邮件学习识别垃圾邮件
系统从没有标签的数据中发现结构
根据购买记录自动发现具有相似行为的顾客群体
系统通过行动获得奖励并调整策略
通过游戏得分反馈学习更有效的行动策略
监督答案、模式识别和行动奖励,构成了三种不同的学习反馈模式
探索环境、尝试行动,从错误中学习,进而改变环境

智能也表现为系统能否在变化的环境中持续调整行动
数据只有和语义结合,才能描述事物
“管理就是决策”
“人的行为意在理性,但只能是有限理性的”
Herbert Simon,《管理行为》,1947
数据只有与任务、指标和使用场景结合,才能支持可用判断
多层网络在数据和算力支持下,学习复杂输入中的表示

系统从数据中逐层形成有用特征
大型数据集提供更丰富的训练样本
专用硬件加速大量矩阵和向量运算
多层神经网络可以提取特征,但能力受数据、算力和任务约束
多层表示学习让模型能够直接处理更复杂的原始信号
从像素中逐层学习边缘、形状与对象特征
例如:识别生产线照片中的表面缺陷
从波形中学习音素、节奏与声学模式
例如:把课堂录音转写成文字
从词元序列中学习语义、语境与表达关系
例如:判断用户评论的情感倾向
多模态系统同样会受到数据偏差、任务错配和人工复核的约束
方法积累需要与数据规模、计算能力和工程工具同时相遇
计算设备昂贵,数据规模有限,训练周期漫长
算力增长、互联网数据和并行计算共同降低训练门槛

每一种新范式都在解决上一种范式的核心局限,同时带来新的问题
明确表达知识,但获取成本高且系统脆弱
从经验学习,但依赖数据、任务与指标
输入输出能力增强,但难以解释与验证
模型进入行动循环,风险也进入真实环境

AI 寒冬提醒我们,应该区分演示、支撑条件与可靠应用
“所有模型都是错的,但有些是有用的”
George Box,《经验模型构建与响应曲面》,1987
展示结果只覆盖特定任务和环境
在基准题上得分很高,不代表能处理真实业务中的异常情况
数据、算力和工程条件无法支撑设想
依赖昂贵算力和人工清洗数据,部署后未必能维持同等表现
真实工作还需要验证、维护和责任机制
建议还要经过证据核对、权限控制和责任确认
评价 AI 技术时,要问它在哪个任务、哪些条件和谁负责的边界内可靠
同一个语言模型可以在上下文中处理多种任务,而不必为每项任务重建系统
说明概念、材料和方案之间的关系
例如:向刚入学的研究生解释强化学习,并给出一个生活例子
形成文本、代码、图像或结构化草稿
例如:根据访谈记录生成一份三段式会议纪要,加粗重点和待办事项
完成改写、翻译、提取和格式迁移
例如:把以下表格数据改写为适合汇报的三条结论,使用金字塔原则
根据上下文比较候选方案并给出步骤
例如:比较两个方案的成本、风险和适用条件,并给出选择依据
模型参数、当前上下文和外部工具共同决定一次任务能做什么
保存训练形成的语言模式和一般能力
本次任务的目标、材料、示例和限制
补充实时信息、确定计算和真实世界操作
2.8T 总参数
约 428B 总参数,约 23B 激活
1.6T 总参数,49B 激活
175B,GPT-4 至 GPT-5.6 未公开
未公开,Claude 各代均无可信公开数字
不会编程的人也能描述目标,但自然语言的模糊性仍然是问题
“与其把主要任务想象为告诉计算机做什么,不如着力向人解释我们希望计算机做什么”
Donald Knuth,《文档化编程》,1984
用日常语言表达意图和修改要求
20 世纪 70 年代的自然语言编程探索,希望人能用日常语言描述程序
同一句话可能隐藏不同标准、范围
1978 年 Dijkstra 提出质疑,认为精确表达不能被表面友好取代
自然语言降低了表达门槛,但并没有降低对理解能力的需求
稳定的结果依赖目标、上下文、材料、格式、工具和验证方式
将下方课堂录音转写整理为结构清楚的 Markdown 文档:保留讲授顺序,不补写原文没有的事实;按主题设置二、三级标题;提取概念、例子、争议和结论
首次出现的关键概念写成 [[概念名]],文末列出相关概念;听不清、术语不确定或来源缺失处标为 〔待核对〕;输出前检查标题层级、链接与原文可追溯性
课堂录音转写:{{在此粘贴转写稿}}
要获得可靠结果,还需要仔细考虑内容来源、清晰约束和必要检查点
表达流畅、调用工具和连续行动都会增强能力,也会放大错误影响范围
输出可能过时、遗漏或生成不存在的信息
例如:模型可能把教师未提及的理论或事实补进课堂笔记
工具权限越大,错误越可能进入真实系统
例如:拥有文件写入权限的智能体可能覆盖原始转写稿
模型不能替代人承担最终判断和最终责任
例如:课程笔记最终是否完整全面,仍然需要用户复核并修改
AI 越接近真实行动,越需要同时约束事实可靠性、行动权限和责任归属
对应从单次生成到完整任务系统的不同范围
根据输入生成预测、文本或其他输出
例如:用 Kimi 根据课堂转写稿生成课程笔记提纲
完成一个边界明确的外部操作
例如:用 OpenAI Whisper 将课堂录音转写为带时间戳的文本
围绕目标选择行动并根据反馈调整
例如:用 Codex 读取转写稿、术语表和现有笔记,生成 Markdown
组织人、模型、工具、脚本和检查点
例如:用字节跳动扣子串联上传、转写、整理、人工复核和归档
面向目标的系统需要进入行动、观察和再行动的反馈循环
读取用户目标和环境状态
分解任务并选择下一步行动
调用工具、脚本或外部系统
读取结果、错误和环境变化
继续行动或在边界处停止

目标、工具、停止条件、验证和人工复核共同框定智能体的行动范围
说明成功标准和允许放弃的条件
例如:把目标限定为将一节课录音整理成结构清楚、忠实原意的 Markdown 笔记
限制可访问的数据、权限和外部系统
例如:只读取本节录音与课程资料,不覆盖原始录音,也不直接撰写最终笔记
遇到异常、高风险或证据不足时转交人工
例如:遇到听不清、术语不确定或来源缺失时标记待核对,并明确提醒用户
智能体越强,越要事先定义它能读什么、能改什么、什么时候该停下
任务一旦被外化,就可以检查执行过程中的关键对象

论文 PDF、问题清单、笔记模板
解析结构,定位方法、结论与局限
论文提纲、证据摘录、待核实问题
对照原文,核对概念与论证关系
带准确引文和页码的论文笔记
只有过程清晰可见,才有机会被复查、复用和改进
一个常见任务可以被拆成连续、可检查的中间步骤
以课堂录音为原始材料
语音识别把声音转成可处理文本
AI 按提示词将文本生成笔记草稿
用户检查错词、遗漏;判断重点
输出讲义、复习材料或 Skill

课堂笔记由一组逐步收敛的中间产物组成——渐进式处理
保留录音、课程内容文本和相关资料
用来判断遗漏发生在采集阶段还是后续处理阶段
明确列出错词、断句和识别遗漏
可以逐段回听并定位错误的原始位置
呈现概念层级、重点与结论
可以检查内容是否忠实于原始材料
每个步骤都要留痕;中间产物越清楚,错误越容易被定位
把过程外化之后,任务才能被观察、复查和迁移
明确呈现输入、步骤、中间产物、输出
管理者和协作者能够看见任务如何推进
错误可以定位到具体工作节点
复核者无需从最终答案反推问题原因
稳定步骤可以沉淀为模板、脚本或 Skill
其他人可以沿用既有流程完成同类任务
标准化工作流降低培训成本,也降低岗位对个人隐性经验的依赖
从明确目的开始,以解释和应用结果结束,并引出下一个问题
数据分析是为了理解什么问题
从可信来源获取所需数据
处理无关、缺失、重复与异常数据
选择方法,并保留可复算过程
解释结果,以结论支持决策

任务性质决定分工,工具不能替代判断
找数据、提出分析方向、发现可能的关系
例如问卷分析,先确认研究问题、字段含义和可能的比较方向
清洗数据、处理重复、生成可复算图表
把已经明确的处理规则写成脚本,批量执行并保留过程记录
判断来源可信度、异常取舍和结论边界
人工核对异常样本,并判断数据能否支持准备表达的结论
好的协作需要知人善任,能把不同任务交给合适的角色
处理模糊问题、生成候选方案、把规则转成草稿
提出分类框架、寻找数据源、获取数据、判断数据是否充分
完成规则明确、重复发生、可以精确验证的操作
批量去重、统一格式、按照固定规则运算并生成可视化图表
提供语境、设定标准、评估风险并最终承担责任
决定哪些证据可信、哪些例外保留、最终结论如何表达
是否采用 AI 输出,取决于验证条件是否被满足
能否用来源、规则或独立方法检查
越缺少独立检查方法的过程,越需要人工逐项核对
错误会造成多大的时间、金钱或安全损失
医疗、财务和管理决策需要更严格的多方面复核
最终决定由谁签字、解释和承担后果
需要签字和解释的结果,不能交给人工智能来生成最终结果
越难独立验证、错误代价越高、责任越明确,人工复核越不能省略
AI 生成内容的偏差经常暴露人尚未表达的隐性标准
模糊要求:整理一份高质量论文笔记
明确标准:每条结论标注页码,无法核对的内容列入待确认清单
人明确验收标准,脚本检查确定规则,人复核无法自动验证的结果
有效应用 AI,需要组织任务分工、理解技术条件并控制行动边界
什么是人工智能,它是如何发展的
新技术的新能力、支撑条件与局限
模型、工具、智能体和完整工作流
输入、中间产物、检查点和输出
有效使用 AI 的关键,是把任务、证据、边界和责任组织成可复查的工作流