返回 Posts

从聊天机器人到 Agent:一张 AI 知识地图

写给零 AI 基础读者的全景地图:分清模型、聊天产品、Agent、API、GUI/CLI/IDE、Goal、Skill 与 MCP,并用 GitHub Copilot 的 VS Code 插件理解补全、Chat 和 Agent。

不想了解概念?直接去第二篇:准备环境、第一次日常工作、申请与管理 API、自定义模型与中转,或者 Goal、Subagent、Skill 与 MCP。这些入口位于本页第一屏,打开后可以直接照做。

本文负责回答“这些东西分别是什么、为什么值得用、如何选择”;下一篇实战负责回答“我今天具体点哪里、输什么、怎样检查结果”。价格、套餐、模型名、安装方式和地区资格会变化,初版资料核验于 2026-08-17,GitHub Copilot 专节核验于 2026-08-18,操作时应再次打开文末官方入口。

1. 这篇文章写给谁

这篇文章写给主要使用 Windows 或 macOS 的普通工作者。你可能每天整理会议记录、写报告、改 PPT、归类文件;也可能偶尔处理仿真结果、CSV 或日志。你不需要先会编程,也不需要先买订阅或 API。

目标不是记住所有缩写,而是建立一张不会轻易过时的地图。以后再遇到新模型、新客户端或新套餐,你能判断它属于哪一层、需要什么账号、会把数据发到哪里、费用落在哪张账单。

2. 用一句话解释 Agent

Agent 是一个能围绕目标规划步骤、使用获准工具、生成或修改成果,并把过程交给人复核的执行系统。

模型不等于 Agent。模型负责理解和生成;Agent 把模型与文件、终端、浏览器等工具连起来。Agent 也不等于“全自动”:可靠工作流一定包含权限边界、来源检查和人工接收。

3. AI 世界分层图:模型 → API → 产品/客户端 → 工具 → 成果

以“把三份零散材料整理成周报”为例:

表格:层 / 人话解释 / 在例子里做什么
层 人话解释 在例子里做什么
模型 理解和生成内容的计算系统 摘要、写作、判断下一步
API 程序调用模型的入口 让 Agent 把请求发给模型服务
产品/客户端 你实际打开的应用 网页聊天、桌面 GUI、CLI、IDE 插件
工具 Agent 获准使用的能力 读写文件、运行命令、查询资料
成果 要交付的文件或结论 Markdown、PPTX、HTML、表格、图表
人工复核 最终责任所在 核对事实、权限、版式、费用并接收

服务实际运行的位置还可能是厂商云 API、订阅内服务、公司网关或本地模型。把这些层拆开,很多问题就容易判断:软件装好了但没模型额度,网页能打开但不能创建 Key,或者一个兼容地址能回文字却不会调用工具。

4. Agent 与网页聊天机器人的差别

网页聊天机器人的默认动作是“你问一句,它答一句”,结果通常停留在对话框。Agent 更接近“查看现状 → 拆步骤 → 使用工具 → 写入新成果 → 检查 → 汇报”。

例如“帮我修改报告”:

  • 网页聊天可能返回一段改写文字,等你复制粘贴;
  • Agent 可以在指定文件夹读取原稿和反馈,修改副本,生成差异,再等你确认。

两者没有绝对高下。只需讨论思路时,网页聊天更简单;需要反复处理文件、执行检查、生成多种交付物时,Agent 的价值更明显。

5. 日常工作价值

对多数人,Agent 最先值得用在低风险、可复核的重复工作:

  • 把会议记录、项目背景和状态更新整理成有来源的文档;
  • 比较两版报告,列出新增、删除和待确认项;
  • 根据已核实文档生成 PPTX 与手机可读的自包含 HTML;
  • 从多个文件提取待办、日期和责任角色;
  • 先提出批量改名或归类清单,得到批准后再执行;
  • 检查文档、表格、链接和交付物是否遗漏。

日常主线应是:原始材料只读 → 形成唯一事实源 → 人工核实 → 派生 PPT/HTML 等成果 → 再次核对。

6. 工程扩展

同一套方法也能扩展到芯片设计、仿真和数据分析,但工程数据只作为进阶:

  • 检查 CSV 的列名、类型、单位、缺失和重复;
  • 联结仿真记录与日志时间戳;
  • 按工程阈值、IQR、Z-score 或趋势变化列出异常候选;
  • 生成带单位、阈值和来源的图表;
  • 把候选、证据和未确认项写入报告。

异常候选不等于故障。真实网表、版图、波形、客户信息和未公开仿真数据默认不能上传到个人账户或不明网关;最终判断必须由了解设计和仿真条件的人作出。

7. Agent 为什么不会自动正确

Agent 可能遇到冲突材料、过期资料、格式误读、模型幻觉、工具失败或权限不足。它也可能给出“看起来合理”但没有来源的数字。

可靠性来自过程,不来自一句“请认真”:

  1. 明确唯一事实源;
  2. 让它先只读盘点,再写新文件;
  3. 要求区分来源事实、推断和未确认项;
  4. 保存原始材料和版本;
  5. 对数字、日期、链接、图表和账单逐项复核;
  6. 不让一次失败触发无限自动重试。

8. 网页、桌面 GUI、CLI、IDE 与多模型开源 Agent

这些词描述的是入口或产品类别,不是模型能力等级。

  • **网页聊天:**打开浏览器就能用,适合问答和小文件;通常不直接操作你的本地文件夹。
  • **桌面 GUI:**有按钮、列表和权限提示,适合希望过程更可见的人。
  • **CLI:**在终端中工作,便于处理本地文件、重复命令和批量任务。
  • **IDE 插件:**在 VS Code 等编辑器旁边工作,适合边看内容边修改。
  • **多模型开源 Agent:**客户端代码开放,可以连接多家 Provider 或兼容端点;开源客户端不代表远程模型免费,也不代表每种 Provider 完全兼容。

9. 六类模型提供商的角色

表格:提供商 / 常见角色 / 初学者先核对什么
提供商 常见角色 初学者先核对什么
OpenAI ChatGPT、Codex、OpenAI API ChatGPT 登录还是 API Key;地区和账单
Anthropic Claude、Claude Code、Claude API 免费聊天账户、合格订阅与 API 的差别
Google Gemini、Google AI Studio、Gemini API 免费/付费层、地区、Key 限制和数据条款
Kimi / Moonshot Kimi 产品、开放平台 API、Coding 方案 会员、Coding 方案与开放平台 API 的结算路径
DeepSeek 聊天产品、DeepSeek API OpenAI/Anthropic 格式与实际能力边界
GLM / 智谱 GLM 产品、BigModel API、Coding 方案 通用 API 与 Coding 套餐端点、Key、额度

同一个 Agent 可以连接多家模型;同一家提供商也可以同时提供聊天产品、Agent 和 API。模型名、上下文和价格更新很快,文章不把今天的型号当成永久推荐。

10. 订阅是什么意思

订阅买到的是某个产品在特定规则下的使用权益,可能包含模型、功能、消息量或 Agent 额度。订阅通常不等于通用 API 余额。

Codex 官方认证文档区分 ChatGPT 登录的订阅权益和 API Key 的标准 API 用量计费。Claude Code 也可以走符合条件的订阅或 Console/API 等不同路径。Kimi 会员、Kimi Code 与开放平台 API 同样不应混成一笔余额。

付费前问清:买的是哪个产品?Agent 使用哪条认证路径?费用出现在哪张账单?取消后还有没有已发生费用?

11. API 是什么,是否必须使用

API 是给程序调用模型的入口,API Key 像一把可计费的机器钥匙。它可能让你更精确地选择模型、统计用量和连接多模型 Agent,但不是使用 Agent 的唯一方式。

你可以从三条路开始:

  1. 用官方支持的账号或订阅登录 Agent,不自己管理 API Key;
  2. 直接申请官方 API,按用量付费;
  3. 使用组织批准的网关或可用本地模型。

Key 不能发到群里、贴进截图、写进公开文档或提交到 Git。一次练习最好用专用 Key,设置预算/限额或提醒,完成后查看用量并撤销。

12. 官方 API、第三方中转和本地模型的差别

表格:路径 / 谁提供模型/账单 / 主要优点 / 需要额外核对
路径 谁提供模型/账单 主要优点 需要额外核对
官方 API 模型厂商 文档、模型身份和账单链条较直接 地区、注册、付款、限额
第三方中转 中转方再连接上游 可能聚合模型或转换协议 服务主体、上游真实性、日志、隐私、退款、稳定性
公司网关 组织或其供应商 可统一权限、审计和预算 公司配置、数据范围、功能转发
本地模型 自己或组织的设备 减少向外发送原始内容 硬件、端口、模型能力、工具兼容、维护

中转或网关常要求服务地址、Key 和模型名称。“能收到回答”只证明某类请求通了,不能证明工具调用、缓存、MCP、Skill、文件、上下文、模型身份和计费都等价。

13. GUI、CLI 与 IDE 插件怎么选

表格:形态 / 适合的起点 / 主要代价
形态 适合的起点 主要代价
GUI 不想先学终端、重视可见操作 高级配置和批处理可能较弱
CLI 要批量处理文件、希望过程可复制 需要适应路径、命令和权限提示
IDE 插件 经常改文档或代码、要边看边改 依赖编辑器,工作区权限容易被忽略

CLI 不等于“只有程序员能用”。初学者先学会打开终端、进入专用练习文件夹、读懂将执行的动作就够了。关键操作不能依赖鼠标悬停,移动端查看时也应能看到链接与警告。

14. Codex、Claude Code 与多模型 Agent

表格:候选 / 定位 / 模型/认证路径 / 适合谁
候选 定位 模型/认证路径 适合谁
Codex OpenAI 的 Agent 工具 ChatGPT 登录、API Key 等官方支持路径;自定义 Provider 有协议条件 已在 OpenAI 生态或需要本地文件工作流
Claude Code Anthropic 的终端 Agent 合格 Claude 订阅、Console/API 或官方列出的云路径 已在 Claude 生态、处理长文档和终端任务
GitHub Copilot(VS Code) GitHub 的 AI 编程助手与 IDE 插件入口 GitHub 登录;Copilot Free、个人付费或组织方案 希望在 VS Code 内使用补全、Chat 和 Agent
OpenCode MIT 许可的开源多模型 Agent 具名 Provider、兼容端点或可用本地路径 希望在同一客户端比较多家模型

本教程把 OpenCode 作为多模型开源 Agent 的首选候选。核验于 2026-08-17:官方仓库仍有近期发布,Windows/macOS 都有安装路径;安装本身不要求订阅或信用卡;Kimi/Moonshot、DeepSeek、GLM/智谱有官方 Provider 或厂商集成证据。远程模型仍可能需要账户、套餐或 API 余额。

兼容时要认协议:Codex 当前自定义 model provider 使用 Responses API;只支持 /v1/chat/completions 的声明不足以证明可用。Claude Code 的 ANTHROPIC_BASE_URL 可以指向网关,但 Anthropic 不背书第三方网关,也不支持用网关把 Claude Code 路由到非 Claude 模型。厂商侧协议转换只能算条件性兼容。

15. GitHub Copilot(VS Code 插件)怎么用

先把它放回前面的分层图:GitHub Copilot 是 AI 编程助手产品,VS Code 中的 GitHub Copilot / GitHub Copilot Chat 扩展是 IDE 入口,所选模型负责生成,Ask 以问答和建议为主,Agent 则能借助工具读取和修改工作区、运行命令。GitHub 账户下的 Copilot 方案决定可用模型、功能和额度;走标准 Copilot 登录时不需要自己申请模型 API Key。

截至 2026-08-18,个人用户可以从有月度限额的 Copilot Free 开始,不必先购买付费方案。它不是无限免费:补全、Chat/Agent、可选模型和 AI Credits 都受当日方案限制;额度用完后应等待重置或自行决定是否升级,不能把付费升级当成教程的必要步骤。组织提供的 Copilot 中,Chat 或 Agent 的可用性还可能由管理员策略决定。

安装和登录

  1. 从官网安装或更新 VS Code。
  2. 在 VS Code 状态栏找到 Copilot 图标,选择 Use AI Features,按提示登录 GitHub。当前 VS Code 会自动配置所需扩展;也可以打开 Extensions,搜索由 GitHub 发布的 GitHub Copilot 后安装。命令面板中的 GitHub Copilot: Sign In 是找不到入口时的回退方式。
  3. 第一次只打开一个专用练习文件夹,并只放公开或虚构材料。只有在你确认文件夹来源可信时才授予 Workspace Trust;看到 Copilot 图标进入可用状态后再开始。

四种最常用入口

表格:入口 / 怎么打开 / 适合做什么 / 使用时怎么把关
入口 怎么打开 适合做什么 使用时怎么把关
行内补全 在文件中正常输入,灰色建议出现时按 Tab 接受 补一行、一个小函数、重复格式 不合适就继续输入或按 Esc 忽略;接受后仍要逐行读
Inline Chat 选中一小段内容,macOS 按 ⌘I,Windows/Linux 按 Ctrl+I 局部解释、改写、修复 提示词只描述这一小段的目标,提交前查看差异
Ask 打开 Chat:macOS 按 ⌃⌘I,Windows/Linux 按 Ctrl+Alt+I,在模式选择器选 Ask 理解项目、解释报错、比较方案 选中相关代码或用 #file 指定文件,要求引用上下文,不把回答当事实
Agent 在同一 Chat 的模式选择器选 Agent 多文件修改、运行检查、迭代修复 明确允许范围、禁止事项和验收;逐项查看文件编辑、工具调用与终端命令

如果快捷键与本机冲突,可用命令面板搜索 Chat: Open Chat 或 Inline Chat。VS Code 版本更新后按钮位置可能变化,功能名称和官方文档比截图更可靠。

第一次 Agent 练习可以复制下面这段,再把文件名换成自己的虚构材料:

只在当前练习文件夹内工作。先只读检查 README.md 和 notes.md,并说明计划;
不要删除、移动或覆盖原文件,不安装依赖,不访问外部服务。
把 notes.md 整理为 report.md:每个数字和日期注明来源,推断与未确认项单列。
完成后列出改动文件、验证命令、结果和仍未确认的事项;
如果缺少验证工具就停止并说明,不要自行安装或扩大范围。

初次使用保持 Default Approvals:每次批准前读清工具名称、路径、终端命令和网址,不使用 Bypass Approvals 或 Autopilot 跳过人工确认。完成后打开 Source Control 查看完整 diff,确认没有意外文件或秘密,再亲自运行验证命令。Copilot 能加速修改,但不能替你承担代码、数据、账单和发布责任。

16. Goal、Subagent、Skill 与 MCP

  • **Goal:**明确终点。“写一份 800 字以内、每个数字注明来源、不修改原文件的周报”比“看看材料”更可执行。
  • **Subagent:**被委派边界清楚子任务的执行单元。两个任务会改同一文件时不应盲目并行。
  • **Skill:**可重复的操作规程,例如“生成 PPT 后逐页渲染并检查溢出”。
  • **MCP:**让 Agent 发现和使用外部工具/数据源的协议。它解决连接,不替代权限、隐私和公司政策判断。

名称和具体行为会随产品变化。关系可以记成:Goal 定义结果,Agent 推进,Subagent 分担独立工作,Skill 规定可靠做法,MCP 提供外部能力。

17. 公司数据、权限与结果复核红线

第一次只用虚构或可公开材料,并遵守这些底线:

  • 真实公司文档、客户信息、芯片资料、网表、版图和未公开仿真数据默认不上传;
  • Agent 只获得练习目录的必要权限,先只读,写入新文件,不覆盖原始材料;
  • 第三方网关会增加数据处理方,无法核实主体和政策时不使用真实资料;
  • 不关闭安全软件、不跳过权限确认、不启用无限额自动执行;
  • 最终文档、PPT、HTML、图表和数字都回到来源人工复核。

18. 中国大陆与香港的网络、地区、注册和付款边界

对每个服务分别判断六件事:网页/API 是否可达、是否可能需要 VPN/代理、官方地区是否支持、能否注册、能否付款、公司是否允许。

截至 2026-08-17,OpenAI、Anthropic 与 Google Gemini API 的相关官方地区列表均未列出中国大陆和香港。本任务没有在两地跨运营商做实时网络测试,所以不把“有人能打开”当成地区资格,也不提供绕过地区规则的教程。

Kimi/Moonshot、DeepSeek、GLM/智谱有面向中国大陆的中文账户或支付资料;这不能自动证明香港手机号、证件、币种和付款方式可用。香港读者仍应在注册前查看当日官方说明。VPN 或代理只能改变部分网络路径,不能改变官方资格、服务条款或公司政策。

19. 按基础、任务、敏感度、预算和网络选择起点

依次做五个判断:

  1. **基础:**完全不想用终端,先用 GUI 或官方网页;愿意处理文件再学最少 CLI。
  2. **任务:**只问问题用聊天;反复读写文件、批处理和检查用 Agent。
  3. **敏感度:**虚构/公开材料可练习;公司材料先确认政策和数据边界。
  4. **预算:**已有合格订阅可先用官方登录;API 路径先设小额预算和提醒;不要为教程仓促充值。
  5. **网络:**官方地区、注册、付款和公司网络均成立后再长期采用。

从一个专用文件夹和一个可复核任务开始。等闭环稳定后,再增加 API、Skill、MCP 或 Subagent。

20. 下一步:用虚构材料走一遍

如果只记住一句话:Agent 不是“一个更会聊天的模型”,而是模型、客户端、工具、权限、数据、费用和人工复核共同组成的工作系统。

现在打开《让 Agent 真正干活:安装、API 与日常工作实战》,用完全虚构的会议记录、项目背景、状态更新、CSV 和日志完成第一轮。

官方入口与核验日期

以下页面初版核验于 2026-08-17,GitHub Copilot / VS Code 条目核验于 2026-08-18;易变信息以操作时的页面为准: