从聊天机器人到 Agent:一张 AI 知识地图
写给零 AI 基础读者的全景地图:分清模型、聊天产品、Agent、API、GUI/CLI/IDE、Goal、Skill 与 MCP,并用 GitHub Copilot 的 VS Code 插件理解补全、Chat 和 Agent。
不想了解概念?直接去第二篇:准备环境、第一次日常工作、申请与管理 API、自定义模型与中转,或者 Goal、Subagent、Skill 与 MCP。这些入口位于本页第一屏,打开后可以直接照做。
本文负责回答“这些东西分别是什么、为什么值得用、如何选择”;下一篇实战负责回答“我今天具体点哪里、输什么、怎样检查结果”。价格、套餐、模型名、安装方式和地区资格会变化,初版资料核验于 2026-08-17,GitHub Copilot 专节核验于 2026-08-18,操作时应再次打开文末官方入口。
1. 这篇文章写给谁
这篇文章写给主要使用 Windows 或 macOS 的普通工作者。你可能每天整理会议记录、写报告、改 PPT、归类文件;也可能偶尔处理仿真结果、CSV 或日志。你不需要先会编程,也不需要先买订阅或 API。
目标不是记住所有缩写,而是建立一张不会轻易过时的地图。以后再遇到新模型、新客户端或新套餐,你能判断它属于哪一层、需要什么账号、会把数据发到哪里、费用落在哪张账单。
2. 用一句话解释 Agent
Agent 是一个能围绕目标规划步骤、使用获准工具、生成或修改成果,并把过程交给人复核的执行系统。
模型不等于 Agent。模型负责理解和生成;Agent 把模型与文件、终端、浏览器等工具连起来。Agent 也不等于“全自动”:可靠工作流一定包含权限边界、来源检查和人工接收。
3. AI 世界分层图:模型 → API → 产品/客户端 → 工具 → 成果
以“把三份零散材料整理成周报”为例:
| 层 | 人话解释 | 在例子里做什么 |
|---|---|---|
| 模型 | 理解和生成内容的计算系统 | 摘要、写作、判断下一步 |
| API | 程序调用模型的入口 | 让 Agent 把请求发给模型服务 |
| 产品/客户端 | 你实际打开的应用 | 网页聊天、桌面 GUI、CLI、IDE 插件 |
| 工具 | Agent 获准使用的能力 | 读写文件、运行命令、查询资料 |
| 成果 | 要交付的文件或结论 | Markdown、PPTX、HTML、表格、图表 |
| 人工复核 | 最终责任所在 | 核对事实、权限、版式、费用并接收 |
服务实际运行的位置还可能是厂商云 API、订阅内服务、公司网关或本地模型。把这些层拆开,很多问题就容易判断:软件装好了但没模型额度,网页能打开但不能创建 Key,或者一个兼容地址能回文字却不会调用工具。
4. Agent 与网页聊天机器人的差别
网页聊天机器人的默认动作是“你问一句,它答一句”,结果通常停留在对话框。Agent 更接近“查看现状 → 拆步骤 → 使用工具 → 写入新成果 → 检查 → 汇报”。
例如“帮我修改报告”:
- 网页聊天可能返回一段改写文字,等你复制粘贴;
- Agent 可以在指定文件夹读取原稿和反馈,修改副本,生成差异,再等你确认。
两者没有绝对高下。只需讨论思路时,网页聊天更简单;需要反复处理文件、执行检查、生成多种交付物时,Agent 的价值更明显。
5. 日常工作价值
对多数人,Agent 最先值得用在低风险、可复核的重复工作:
- 把会议记录、项目背景和状态更新整理成有来源的文档;
- 比较两版报告,列出新增、删除和待确认项;
- 根据已核实文档生成 PPTX 与手机可读的自包含 HTML;
- 从多个文件提取待办、日期和责任角色;
- 先提出批量改名或归类清单,得到批准后再执行;
- 检查文档、表格、链接和交付物是否遗漏。
日常主线应是:原始材料只读 → 形成唯一事实源 → 人工核实 → 派生 PPT/HTML 等成果 → 再次核对。
6. 工程扩展
同一套方法也能扩展到芯片设计、仿真和数据分析,但工程数据只作为进阶:
- 检查 CSV 的列名、类型、单位、缺失和重复;
- 联结仿真记录与日志时间戳;
- 按工程阈值、IQR、Z-score 或趋势变化列出异常候选;
- 生成带单位、阈值和来源的图表;
- 把候选、证据和未确认项写入报告。
异常候选不等于故障。真实网表、版图、波形、客户信息和未公开仿真数据默认不能上传到个人账户或不明网关;最终判断必须由了解设计和仿真条件的人作出。
7. Agent 为什么不会自动正确
Agent 可能遇到冲突材料、过期资料、格式误读、模型幻觉、工具失败或权限不足。它也可能给出“看起来合理”但没有来源的数字。
可靠性来自过程,不来自一句“请认真”:
- 明确唯一事实源;
- 让它先只读盘点,再写新文件;
- 要求区分来源事实、推断和未确认项;
- 保存原始材料和版本;
- 对数字、日期、链接、图表和账单逐项复核;
- 不让一次失败触发无限自动重试。
8. 网页、桌面 GUI、CLI、IDE 与多模型开源 Agent
这些词描述的是入口或产品类别,不是模型能力等级。
- **网页聊天:**打开浏览器就能用,适合问答和小文件;通常不直接操作你的本地文件夹。
- **桌面 GUI:**有按钮、列表和权限提示,适合希望过程更可见的人。
- **CLI:**在终端中工作,便于处理本地文件、重复命令和批量任务。
- **IDE 插件:**在 VS Code 等编辑器旁边工作,适合边看内容边修改。
- **多模型开源 Agent:**客户端代码开放,可以连接多家 Provider 或兼容端点;开源客户端不代表远程模型免费,也不代表每种 Provider 完全兼容。
9. 六类模型提供商的角色
| 提供商 | 常见角色 | 初学者先核对什么 |
|---|---|---|
| OpenAI | ChatGPT、Codex、OpenAI API | ChatGPT 登录还是 API Key;地区和账单 |
| Anthropic | Claude、Claude Code、Claude API | 免费聊天账户、合格订阅与 API 的差别 |
| Gemini、Google AI Studio、Gemini API | 免费/付费层、地区、Key 限制和数据条款 | |
| Kimi / Moonshot | Kimi 产品、开放平台 API、Coding 方案 | 会员、Coding 方案与开放平台 API 的结算路径 |
| DeepSeek | 聊天产品、DeepSeek API | OpenAI/Anthropic 格式与实际能力边界 |
| GLM / 智谱 | GLM 产品、BigModel API、Coding 方案 | 通用 API 与 Coding 套餐端点、Key、额度 |
同一个 Agent 可以连接多家模型;同一家提供商也可以同时提供聊天产品、Agent 和 API。模型名、上下文和价格更新很快,文章不把今天的型号当成永久推荐。
10. 订阅是什么意思
订阅买到的是某个产品在特定规则下的使用权益,可能包含模型、功能、消息量或 Agent 额度。订阅通常不等于通用 API 余额。
Codex 官方认证文档区分 ChatGPT 登录的订阅权益和 API Key 的标准 API 用量计费。Claude Code 也可以走符合条件的订阅或 Console/API 等不同路径。Kimi 会员、Kimi Code 与开放平台 API 同样不应混成一笔余额。
付费前问清:买的是哪个产品?Agent 使用哪条认证路径?费用出现在哪张账单?取消后还有没有已发生费用?
11. API 是什么,是否必须使用
API 是给程序调用模型的入口,API Key 像一把可计费的机器钥匙。它可能让你更精确地选择模型、统计用量和连接多模型 Agent,但不是使用 Agent 的唯一方式。
你可以从三条路开始:
- 用官方支持的账号或订阅登录 Agent,不自己管理 API Key;
- 直接申请官方 API,按用量付费;
- 使用组织批准的网关或可用本地模型。
Key 不能发到群里、贴进截图、写进公开文档或提交到 Git。一次练习最好用专用 Key,设置预算/限额或提醒,完成后查看用量并撤销。
12. 官方 API、第三方中转和本地模型的差别
| 路径 | 谁提供模型/账单 | 主要优点 | 需要额外核对 |
|---|---|---|---|
| 官方 API | 模型厂商 | 文档、模型身份和账单链条较直接 | 地区、注册、付款、限额 |
| 第三方中转 | 中转方再连接上游 | 可能聚合模型或转换协议 | 服务主体、上游真实性、日志、隐私、退款、稳定性 |
| 公司网关 | 组织或其供应商 | 可统一权限、审计和预算 | 公司配置、数据范围、功能转发 |
| 本地模型 | 自己或组织的设备 | 减少向外发送原始内容 | 硬件、端口、模型能力、工具兼容、维护 |
中转或网关常要求服务地址、Key 和模型名称。“能收到回答”只证明某类请求通了,不能证明工具调用、缓存、MCP、Skill、文件、上下文、模型身份和计费都等价。
13. GUI、CLI 与 IDE 插件怎么选
| 形态 | 适合的起点 | 主要代价 |
|---|---|---|
| GUI | 不想先学终端、重视可见操作 | 高级配置和批处理可能较弱 |
| CLI | 要批量处理文件、希望过程可复制 | 需要适应路径、命令和权限提示 |
| IDE 插件 | 经常改文档或代码、要边看边改 | 依赖编辑器,工作区权限容易被忽略 |
CLI 不等于“只有程序员能用”。初学者先学会打开终端、进入专用练习文件夹、读懂将执行的动作就够了。关键操作不能依赖鼠标悬停,移动端查看时也应能看到链接与警告。
14. Codex、Claude Code 与多模型 Agent
| 候选 | 定位 | 模型/认证路径 | 适合谁 |
|---|---|---|---|
| Codex | OpenAI 的 Agent 工具 | ChatGPT 登录、API Key 等官方支持路径;自定义 Provider 有协议条件 | 已在 OpenAI 生态或需要本地文件工作流 |
| Claude Code | Anthropic 的终端 Agent | 合格 Claude 订阅、Console/API 或官方列出的云路径 | 已在 Claude 生态、处理长文档和终端任务 |
| GitHub Copilot(VS Code) | GitHub 的 AI 编程助手与 IDE 插件入口 | GitHub 登录;Copilot Free、个人付费或组织方案 | 希望在 VS Code 内使用补全、Chat 和 Agent |
| OpenCode | MIT 许可的开源多模型 Agent | 具名 Provider、兼容端点或可用本地路径 | 希望在同一客户端比较多家模型 |
本教程把 OpenCode 作为多模型开源 Agent 的首选候选。核验于 2026-08-17:官方仓库仍有近期发布,Windows/macOS 都有安装路径;安装本身不要求订阅或信用卡;Kimi/Moonshot、DeepSeek、GLM/智谱有官方 Provider 或厂商集成证据。远程模型仍可能需要账户、套餐或 API 余额。
兼容时要认协议:Codex 当前自定义 model provider 使用 Responses API;只支持 /v1/chat/completions 的声明不足以证明可用。Claude Code 的 ANTHROPIC_BASE_URL 可以指向网关,但 Anthropic 不背书第三方网关,也不支持用网关把 Claude Code 路由到非 Claude 模型。厂商侧协议转换只能算条件性兼容。
15. GitHub Copilot(VS Code 插件)怎么用
先把它放回前面的分层图:GitHub Copilot 是 AI 编程助手产品,VS Code 中的 GitHub Copilot / GitHub Copilot Chat 扩展是 IDE 入口,所选模型负责生成,Ask 以问答和建议为主,Agent 则能借助工具读取和修改工作区、运行命令。GitHub 账户下的 Copilot 方案决定可用模型、功能和额度;走标准 Copilot 登录时不需要自己申请模型 API Key。
截至 2026-08-18,个人用户可以从有月度限额的 Copilot Free 开始,不必先购买付费方案。它不是无限免费:补全、Chat/Agent、可选模型和 AI Credits 都受当日方案限制;额度用完后应等待重置或自行决定是否升级,不能把付费升级当成教程的必要步骤。组织提供的 Copilot 中,Chat 或 Agent 的可用性还可能由管理员策略决定。
安装和登录
- 从官网安装或更新 VS Code。
- 在 VS Code 状态栏找到 Copilot 图标,选择 Use AI Features,按提示登录 GitHub。当前 VS Code 会自动配置所需扩展;也可以打开 Extensions,搜索由 GitHub 发布的 GitHub Copilot 后安装。命令面板中的
GitHub Copilot: Sign In是找不到入口时的回退方式。 - 第一次只打开一个专用练习文件夹,并只放公开或虚构材料。只有在你确认文件夹来源可信时才授予 Workspace Trust;看到 Copilot 图标进入可用状态后再开始。
四种最常用入口
| 入口 | 怎么打开 | 适合做什么 | 使用时怎么把关 |
|---|---|---|---|
| 行内补全 | 在文件中正常输入,灰色建议出现时按 Tab 接受 |
补一行、一个小函数、重复格式 | 不合适就继续输入或按 Esc 忽略;接受后仍要逐行读 |
| Inline Chat | 选中一小段内容,macOS 按 ⌘I,Windows/Linux 按 Ctrl+I |
局部解释、改写、修复 | 提示词只描述这一小段的目标,提交前查看差异 |
| Ask | 打开 Chat:macOS 按 ⌃⌘I,Windows/Linux 按 Ctrl+Alt+I,在模式选择器选 Ask |
理解项目、解释报错、比较方案 | 选中相关代码或用 #file 指定文件,要求引用上下文,不把回答当事实 |
| Agent | 在同一 Chat 的模式选择器选 Agent | 多文件修改、运行检查、迭代修复 | 明确允许范围、禁止事项和验收;逐项查看文件编辑、工具调用与终端命令 |
如果快捷键与本机冲突,可用命令面板搜索 Chat: Open Chat 或 Inline Chat。VS Code 版本更新后按钮位置可能变化,功能名称和官方文档比截图更可靠。
第一次 Agent 练习可以复制下面这段,再把文件名换成自己的虚构材料:
只在当前练习文件夹内工作。先只读检查 README.md 和 notes.md,并说明计划;
不要删除、移动或覆盖原文件,不安装依赖,不访问外部服务。
把 notes.md 整理为 report.md:每个数字和日期注明来源,推断与未确认项单列。
完成后列出改动文件、验证命令、结果和仍未确认的事项;
如果缺少验证工具就停止并说明,不要自行安装或扩大范围。
初次使用保持 Default Approvals:每次批准前读清工具名称、路径、终端命令和网址,不使用 Bypass Approvals 或 Autopilot 跳过人工确认。完成后打开 Source Control 查看完整 diff,确认没有意外文件或秘密,再亲自运行验证命令。Copilot 能加速修改,但不能替你承担代码、数据、账单和发布责任。
16. Goal、Subagent、Skill 与 MCP
- **Goal:**明确终点。“写一份 800 字以内、每个数字注明来源、不修改原文件的周报”比“看看材料”更可执行。
- **Subagent:**被委派边界清楚子任务的执行单元。两个任务会改同一文件时不应盲目并行。
- **Skill:**可重复的操作规程,例如“生成 PPT 后逐页渲染并检查溢出”。
- **MCP:**让 Agent 发现和使用外部工具/数据源的协议。它解决连接,不替代权限、隐私和公司政策判断。
名称和具体行为会随产品变化。关系可以记成:Goal 定义结果,Agent 推进,Subagent 分担独立工作,Skill 规定可靠做法,MCP 提供外部能力。
17. 公司数据、权限与结果复核红线
第一次只用虚构或可公开材料,并遵守这些底线:
- 真实公司文档、客户信息、芯片资料、网表、版图和未公开仿真数据默认不上传;
- Agent 只获得练习目录的必要权限,先只读,写入新文件,不覆盖原始材料;
- 第三方网关会增加数据处理方,无法核实主体和政策时不使用真实资料;
- 不关闭安全软件、不跳过权限确认、不启用无限额自动执行;
- 最终文档、PPT、HTML、图表和数字都回到来源人工复核。
18. 中国大陆与香港的网络、地区、注册和付款边界
对每个服务分别判断六件事:网页/API 是否可达、是否可能需要 VPN/代理、官方地区是否支持、能否注册、能否付款、公司是否允许。
截至 2026-08-17,OpenAI、Anthropic 与 Google Gemini API 的相关官方地区列表均未列出中国大陆和香港。本任务没有在两地跨运营商做实时网络测试,所以不把“有人能打开”当成地区资格,也不提供绕过地区规则的教程。
Kimi/Moonshot、DeepSeek、GLM/智谱有面向中国大陆的中文账户或支付资料;这不能自动证明香港手机号、证件、币种和付款方式可用。香港读者仍应在注册前查看当日官方说明。VPN 或代理只能改变部分网络路径,不能改变官方资格、服务条款或公司政策。
19. 按基础、任务、敏感度、预算和网络选择起点
依次做五个判断:
- **基础:**完全不想用终端,先用 GUI 或官方网页;愿意处理文件再学最少 CLI。
- **任务:**只问问题用聊天;反复读写文件、批处理和检查用 Agent。
- **敏感度:**虚构/公开材料可练习;公司材料先确认政策和数据边界。
- **预算:**已有合格订阅可先用官方登录;API 路径先设小额预算和提醒;不要为教程仓促充值。
- **网络:**官方地区、注册、付款和公司网络均成立后再长期采用。
从一个专用文件夹和一个可复核任务开始。等闭环稳定后,再增加 API、Skill、MCP 或 Subagent。
20. 下一步:用虚构材料走一遍
如果只记住一句话:Agent 不是“一个更会聊天的模型”,而是模型、客户端、工具、权限、数据、费用和人工复核共同组成的工作系统。
现在打开《让 Agent 真正干活:安装、API 与日常工作实战》,用完全虚构的会议记录、项目背景、状态更新、CSV 和日志完成第一轮。
官方入口与核验日期
以下页面初版核验于 2026-08-17,GitHub Copilot / VS Code 条目核验于 2026-08-18;易变信息以操作时的页面为准:
- OpenCode:仓库、安装、Providers
- OpenAI:Codex CLI、认证、自定义 Provider、API 地区
- GitHub Copilot / VS Code:方案、VS Code 设置、行内补全、Ask 与 Agent、Inline Chat、权限与审批
- Anthropic:Claude Code 安装、认证、LLM Gateway、支持地区
- Google:Gemini API 快速开始、价格、可用地区
- Kimi:API 总览、账号与支付、OpenCode 指南
- DeepSeek:API 文档、价格、OpenCode 指南
- GLM/智谱:平台介绍、OpenAI API 兼容、OpenCode 指南