返回 Posts

让 Agent 真正干活:安装、API 与日常工作实战

从 Windows/macOS 安装,到订阅、官方 API、国产模型和兼容端点,再用虚构材料完成文档、PPT、离线 HTML、批处理与 CSV/日志分析。

你不需要会编程,但需要在每一步看清 Agent 将读取什么、修改什么、把数据发给谁。价格、套餐、模型名、安装方式和地区资格核验于 2026-08-17,操作时请再次打开文末官方链接。

按目标跳转:准备环境、无需 API、申请与管理 API、国产模型 API、自定义模型与中转、第一次日常工作、工程数据进阶、Goal、Subagent、Skill 与 MCP。

五句话回顾概念:模型负责理解与生成;API 是程序化入口;Agent 围绕 Goal 使用获准工具;Skill 是可复用操作规程;MCP 连接外部工具或数据。订阅通常不是通用 API 余额。能返回文字也不代表工具、缓存、MCP、模型身份和计费完全兼容。不了解这些也没关系,下面会边做边解释;需要全景图时回看上一篇。

准备环境

1. 选择路线与阅读路径

只选一条开始:

表格:你现在有什么 / 推荐起点 / 暂时跳过
你现在有什么 推荐起点 暂时跳过
已有符合条件的官方订阅 用官方账号登录 Codex 或 Claude Code 自建 API、中转、MCP
想连接 Kimi、DeepSeek、GLM 等多家模型 安装 OpenCode,再连接一个官方 Provider 同时配置多家、长期充值
组织已提供批准的 API/网关 按组织说明配置专用练习目录 个人中转和真实公司资料
什么都没有 只完成软件安装和虚构材料准备 为完成教程仓促购买

OpenCode 是本文的多模型开源 Agent 首选。它满足已核实门槛:MIT 许可、Windows/macOS 安装、近期仍维护、安装本身无需订阅或信用卡、文档说明本地凭据路径,并有 Kimi/Moonshot、DeepSeek、GLM/智谱与自定义端点的官方证据。远程模型仍可能需要账号、套餐或余额。

2. 公司数据、密钥和权限红线

开始前接受六条规则:

  1. 第一次只使用本文的虚构材料;
  2. 真实公司文档、客户、芯片、网表、版图和未公开仿真数据默认不上传;
  3. Agent 只进入练习文件夹,先只读,写入新文件,不覆盖输入;
  4. API Key 不写进文章、Git、截图、聊天记录或共享文档;
  5. 不关闭安全软件、不跳过权限确认、不启用无限额自动执行;
  6. 结果必须回到来源人工复核。

第三方网关会增加一个能处理请求的数据方。即使公司允许某个模型,也不等于允许任意客户端、个人账号或中转。

3. macOS 与 Windows 终端

macOS 打开“终端”。Windows 打开 PowerShell 或 Windows Terminal。命令输入后按回车;看见版本号通常表示成功,看见“找不到命令”则先关闭并重新打开终端,再查安装。

先输入:

node --version
npm --version

如果输出类似版本号,Node.js 与 npm 已可用。不要因为一条命令失败就连续粘贴来历不明的修复脚本。

4. 只安装路线真正需要的软件

表格:软件 / 官方下载 / 用途
软件 官方下载 用途
Node.js nodejs.org npm 安装 OpenCode/Codex;选操作时的 LTS
Git git-scm.com 看差异和回退;第一轮也可先复制文件夹
VS Code code.visualstudio.com 图形化查看 Markdown、HTML 和差异
Python python.org CSV/日志进阶可选;文档主线不要求

安装三种 Agent

5. 分别安装 OpenCode、Codex 与 Claude Code

第一次只装一个。下面命令、系统要求和产品资格都可能变化,请先打开相邻官方链接。

OpenCode:多模型主路线

macOS 或已安装 Node.js 的 Windows PowerShell:

npm install -g opencode-ai
opencode

Windows 官方推荐 WSL,也提供其他原生包管理方式;macOS 还可用 Homebrew,详见官方安装页。

  • 目的:安装并启动 OpenCode;
  • 成功标志:终端出现 OpenCode 界面,可选择模型或连接 Provider;
  • 首要失败检查:重开终端,再运行 node --version 和 npm --version;
  • 撤销:npm uninstall -g opencode-ai,其他安装方式按官方页卸载。

通过 /connect 添加的凭据,OpenCode 文档说明保存在 ~/.local/share/opencode/auth.json。不要提交或公开该文件;官方这一段没有承诺系统钥匙串级加密。

Codex:OpenAI 路线

按 Codex CLI 官方页核对当日安装方式。Node.js 路径:

npm install -g @openai/codex
codex
  • 成功标志:进入会话并看到当前目录;
  • 首要失败检查:认证说明、账号工作区、地区与产品资格;
  • 撤销:npm uninstall -g @openai/codex,再检查本机认证存储。

Codex 可按配置使用系统 keyring 或 ~/.codex/auth.json。ChatGPT 登录使用符合条件的订阅权益;API Key 走标准 API 用量计费。

Claude Code:Anthropic 路线

当前官方原生安装命令包括:

macOS:

curl -fsSL https://claude.ai/install.sh | bash

Windows PowerShell:

irm https://claude.ai/install.ps1 | iex

然后运行 claude。系统要求、WinGet 等替代方式和卸载步骤见官方安装页。

  • 成功标志:进入 Claude Code 会话并完成可用认证;
  • 首要失败检查:系统版本、公司脚本执行政策和认证说明;
  • 撤销:按官方卸载章节操作,再检查凭据。macOS 使用 Keychain;Linux/Windows 的凭据位置见认证页。

免费 Claude.ai 账户本身不含 Claude Code,需要官方列明的订阅、Console/API 或支持云路径。

无需 API

6. 用官方账号、订阅或本地路径起步

“无需 API”表示你不自己创建 API Key,不代表一定免费。

  • 有符合条件的 ChatGPT 订阅:Codex 选择 ChatGPT 登录;
  • 有符合条件的 Claude 订阅:按 Claude Code 认证流程登录;
  • OpenCode 可连接 Provider 套餐或可用本地模型,但账号、硬件、隐私和功能要逐项核对。

优点是少管理一把 Key;限制是可用模型、额度和功能由产品规则决定。OpenCode 可以无付费安装,但没有订阅、API 额度或本地模型时,不能凭空获得模型回复。此时停在安装验证即可。

申请与管理 API

7. API 注册、付款、Key、预算、账单与撤销的共通流程

  1. 查看官方支持地区和公司政策;
  2. 从官方文档进入官方控制台,不点击搜索广告里的仿冒入口;
  3. 阅读价格、充值/后付费、退款和余额有效期;
  4. 只添加完成小测试所需的有限金额;不确定时先不付费;
  5. 创建练习专用 Key,不复用生产 Key;
  6. 放进官方凭据存储或会话环境变量;
  7. 设置可用的项目预算、速率/消费限制和提醒;提醒不一定是硬上限;
  8. 发一个不含敏感信息的小请求,立即查 Usage/账单;
  9. 结束后撤销 Key、删除本地凭据并确认最终账单。

8. OpenAI 与 Anthropic 官方 API

OpenAI

  • **申请:**从 API quickstart进入 API Keys;
  • **付款:**在 Billing查看当前方式,在价格页核对模型;ChatGPT 订阅通常不等于 API 余额;
  • **Key:**创建专用 Key,只复制到受控凭据存储或会话变量;
  • **限额/账单:**在 Usage与 Limits 查看用量、费用和层级;
  • **撤销:**在 Key 页删除,官方说明见删除 API Key;取消 pay-as-you-go 后,当期已发生费用仍可能进入最终账单,见停止 API 付费服务。

Anthropic

  • **申请:**从 Claude API overview进入 Console;
  • **付款:**API 与 Claude 订阅分开,在价格页和 Console 核对当前规则;
  • **Key:**在 Workspace 创建专用 Key,不硬编码到项目;
  • **限额/账单:**查看 rate/spend limits和 usage/cost;
  • **撤销:**删除 Key;归档整个 Workspace 会让其中 Key 立即失效,操作前确认受影响程序。

中国大陆与香港

截至 2026-08-17,OpenAI 支持地区与 Anthropic 支持地区均未列出中国大陆和香港。本文没有跨运营商做实时网络测试,不把“网页能开”“需要 VPN”或“有境外卡”当作官方地区资格,也不提供规避步骤。网络路径、官方地区、注册、付款和公司许可是不同判断。

国产模型 API

9. Kimi、DeepSeek、GLM 与 OpenCode

在 OpenCode 输入 /connect,从当日列表选择 Moonshot AI、DeepSeek 或 Z.AI/智谱,再粘贴对应官方 Key;用 /models 选择当前模型。如果 Provider 不在列表,先升级 OpenCode,不照搬旧模型名。

Kimi / Moonshot

  • **申请/Key:**从 Kimi API 总览进入开放平台;
  • **付款:**个人/企业认证、微信/支付宝或对公路径见账号与支付;
  • **价格/限额:**看价格与限制;项目可设每日预算和余额提醒,是否硬停止按当日控制台核对;
  • **撤销:**在 API Keys 管理页撤销不用的 Key;
  • **OpenCode:**按 Kimi OpenCode 指南选择 Moonshot AI (China)。Kimi 会员、Kimi Code 与开放平台 API 不是同一结算路径。

DeepSeek

GLM / 智谱

  • **申请/Key:**从 BigModel 平台进入,按适用要求注册/实名并创建 Key;
  • **付款:**个人当前可用支付宝/微信,条款和退款边界见充值协议;
  • **价格/限额:**通常按 token 与当前模型单价扣费;认证、欠费、并发、套餐和模型错误要按错误码区分;
  • **撤销:**在 Key 管理页撤销并删除本地配置;
  • **OpenCode:**按智谱 OpenCode 指南选择对应 Provider。通用 API 与 Coding 套餐端点和额度不能混配。

大陆与香港分别看

表格:问题 / 中国大陆 / 香港
问题 中国大陆 香港
网络可达性 有大陆官方入口,但本文未做跨运营商实测 未做香港本地实测
VPN/代理 通常不应把代理当作国产平台前置 取决于本地与公司网络;不改变资格
官方地区/注册 大陆账户、实名或支付有官方资料 现有资料不足以统一确认完整香港资格
付款 以当日人民币、本地支付或企业流程为准 手机号、证件、币种、付款工具逐项确认
公司政策 上传公司资料前先获批准 同样先获批准,网络可用不等于允许

10. 安全保存 API Key

优先顺序:产品的系统钥匙串/凭据管理 → Agent 官方凭据文件 → 当前终端的会话环境变量。不要把 Key 写进 project-background.md、opencode.json 明文、PPT 或截图。

macOS 会话变量:

read -s API_KEY
export API_KEY

运行 read -s API_KEY 后粘贴 <API_KEY> 并按回车;终端不会回显输入。

Windows PowerShell:

Set-Item -Path Env:API_KEY -Value (Read-Host "粘贴临时 API Key")

关闭终端会清除这种会话变量,适合第一次测试。若 Key 泄露,先在服务端撤销,再清理本机和 Git 历史;只删除聊天消息不够。

自定义模型与中转

下面只使用 <中转服务地址>、<API_KEY>、<模型名称>。这些配置形态不能证明任何服务的官方兼容、安全、隐私、稳定性或模型真实性。

11. Codex:官方 OpenAI API与 Responses 条件

Codex 使用 OpenAI 官方路径时,按认证说明选择 ChatGPT 登录或 OpenAI API Key。自定义 Provider 的通用 ~/.codex/config.toml 形态:

model = "<模型名称>"
model_provider = "custom"

[model_providers.custom]
name = "custom"
base_url = "<中转服务地址>"
env_key = "API_KEY"
wire_api = "responses"

根据 Codex 高级配置和配置参考,核验日的 wire_api 支持值为 responses。只宣称兼容 /v1/chat/completions 不足以证明 Codex 可用;还要确认 Responses、流式事件、工具调用和错误语义。

12. Claude Code:官方 API、Base URL 与 LLM Gateway

官方 Anthropic API 路径按 Claude Code 认证配置。网关会话变量形态:

macOS:

export ANTHROPIC_BASE_URL="<中转服务地址>"
read -s ANTHROPIC_AUTH_TOKEN
export ANTHROPIC_AUTH_TOKEN
export ANTHROPIC_MODEL="<模型名称>"

运行 read -s ANTHROPIC_AUTH_TOKEN 后粘贴 <API_KEY> 并按回车;终端不会回显输入。

Windows PowerShell:

$env:ANTHROPIC_BASE_URL="<中转服务地址>"
$env:ANTHROPIC_AUTH_TOKEN = Read-Host "粘贴临时 API Key"
$env:ANTHROPIC_MODEL="<模型名称>"

Windows 的 Read-Host 输入可能可见,只在没有旁观者和录屏时操作;用完关闭终端并撤销测试 Key。

ANTHROPIC_BASE_URL 只改变请求去向,不自动替代订阅、凭据或账单。LLM Gateway 文档要求网关跟进 Claude Code 使用的协议能力;环境变量文档提示非第一方端点可能影响 MCP tool search。Anthropic 不审计或背书第三方网关,并明确不支持用网关把 Claude Code 路由到非 Claude 模型。

DeepSeek 等厂商可能提供自己的 Anthropic 格式转换;这只能证明厂商侧条件性路径,不是 Anthropic 的非 Claude 模型保证。

13. 匿名第三方中转:注册、充值、Key、通用配置与风险

在注册前先核实主体、条款、隐私、日志、上游模型声明和支持渠道。充值前确认币种、余额有效期、退款、失败请求计费和是否自动扣费;不要预存大额。创建只用于测试的 Key,不复用官方生产 Key。

OpenCode 的 Chat Completions 类自定义形态:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "custom": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "自定义兼容端点",
      "options": {
        "baseURL": "<中转服务地址>",
        "apiKey": "{env:API_KEY}"
      },
      "models": {
        "<模型名称>": { "name": "<模型名称>" }
      }
    }
  }
}

若端点实现 Responses,应按 OpenCode Provider 文档使用相应 @ai-sdk/openai 路径,不能只改 URL 猜测。

最小验证必须逐项看:模型能否明确选择、文件工具是否真的执行、工具结果能否回传、缓存/MCP/Skill 是否工作、用量落在哪个账户、模型身份如何证明。只要一项没测,就只能写“未确认”。结束后删配置、关终端、撤销 Key,并查未结账单。

第一次日常工作

14. 建立完全虚构的工作文件夹

下载并放进 ai-agent-work-practice 文件夹:

五个文件完全虚构。保留未修改备份。进入目录:

macOS:

cd ~/Downloads/ai-agent-work-practice

Windows PowerShell:

cd "$HOME\Downloads\ai-agent-work-practice"

路径不同就从 Finder/资源管理器复制实际路径,不要盲猜。然后启动选定 Agent,例如 opencode。

15. 只读盘点材料并生成大纲

只读取 meeting-notes.txt、project-background.md 和 status-updates.txt。
不要联网,不要修改文件。
列出项目名称、汇报周期、全部数字、风险、目标日期和来源文件。
发现冲突先报告,不自行决定;最后提出 weekly-report.md 大纲。

成功标志:找到 18 份材料、16 份已分类、95 分钟基线、28 分钟试点、5/6 项交付物和三个目标日期。若不一致,先停下核对输入。

16. 写初稿,分开事实、推断和未确认项

综合三份盘点结果生成 weekly-report-draft.md;project-background.md 只提供已确认的目标、范围和角色。
结构:概览、关键指标、本周进展、异常候选、风险与下一步、来源。
每个结论标记为“来源事实”“推断”或“未确认”;不要新增数字。
不同输入有冲突时保留冲突,不自行选边。
异常候选必须写明“不是故障结论”。

检查有没有输入里不存在的人名、公司、产品或数字。推断可以保留,但必须有标签;未确认项不能被改写成确定结论。

17. 根据反馈修改并生成工作报告

给出定点反馈,例如“把 95→28 分钟的计算式写清楚”“把两份缺少责任角色的材料移到风险”“来源只引用文件名”。然后要求:

根据以上反馈生成 weekly-report.md,不覆盖输入和初稿。
写完重新读取成品,与三份原始输入逐项核对数字、日期和候选。
报告所有差异;没有差异也明确说明核对范围。

人工确认对账无误后,把 weekly-report.md 定为后续 PPTX 与 HTML 的唯一事实源;原始输入继续只读。

18. 从同一事实源生成并检查 PPTX

只从已核实的 weekly-report.md 生成可编辑 briefing.pptx,适合 5 分钟汇报。
不得自行补写数字。生成后逐页渲染,检查文字溢出、遮挡、字号、事实和演讲顺序。

人工确认文字、形状和图表能选中编辑;逐页播放;把关键数字搜索一遍。本文同源参考:example-briefing.pptx。

19. 从同一事实源生成并检查自包含 HTML

只从已核实的 weekly-report.md 生成单文件 report.html。
适合手机阅读,不加载外部 CDN、字体、图片、脚本或追踪,不发网络请求。
显示来源、指标、异常候选、风险和目标日期,不得新增事实。

断网后打开;窗口缩到 390 像素宽,确认没有横向滚动;再检查打印预览。外部托管、邮件附件拦截和公司分享政策要另行评估。本文同源参考:example-report.html。

参考 PPTX、HTML 和事实源都应出现:18/16 份材料、95→28 分钟、5/6 项交付物、30 行工程数据、29 个唯一 run_id、3 个工程阈值候选和 4 个统计型候选。

20. 批量归类、比较版本、提取待办和查遗漏

批量操作先计划后执行:

扫描当前文件夹,不进入子文件夹,不联网。
生成 proposed-actions.md,列出原名、拟议新名、理由、冲突和撤销方式。
不要改名、移动或删除。

人工批准具体项目后,才让 Agent 在副本目录执行。比较报告版本时要求分成新增、删除、数字变化和未解决反馈;提取待办时保留来源文件和原句位置。Word、Excel、PPT、PDF 还要打开或渲染成品,不能只看命令退出码。

工程数据进阶

21. 读取 CSV/日志,先查质量和单位

本文的 simulation-results.csv 与 simulation.log是 30 行完全虚构记录,其中有 29 个唯一 run_id。

只读 simulation-results.csv、simulation.log 和 project-background.md。
检查列名、类型、单位、缺失、重复、记录数、布尔值和明显越界值。
列出数据质量问题和来源;不要修改输入,不要判断故障。

每列只应有一种数据类型;单位来自列名。找不到单位时应写“未确认”,不能猜。

22. 用阈值、IQR/Z-score、趋势和日志关联生成候选

先应用明确工程阈值,再把统计方法当辅助信号:

按 latency_ns <= 8.0、power_mw <= 50.0、error_count = 0 生成工程阈值候选。
再按 corner 分组,说明样本量限制后,分别尝试 IQR 或 Z-score 识别统计候选;
检查温度/电压变化下的趋势,并与 simulation.log 的 WARN 记录关联。
所有结果只写“异常候选”,保留方法、单位、CSV 行和日志证据。

正确的工程阈值候选是:

表格:记录 / 原因
记录 原因
SIM-008 延迟 8.9 ns,高于 8.0 ns
SIM-017 错误计数 3,且延迟 8.2 ns
SIM-022 功耗 54.7 mW,高于 50.0 mW

排除精确重复行和工程阈值候选后,本例的 IQR 没有给出额外候选;按 corner 分组、使用总体标准差的一侧 Z-score,并以 z > 1.5 作宽松筛查时,共有 4 个唯一统计型候选:SIM-016(FF 组延迟 z≈1.573、功耗 z≈1.551)、SIM-021(TT 组功耗 z≈1.749)、SIM-026(TT 组延迟 z≈1.653)与 SIM-028(SS 组功耗 z≈1.745)。30 行数据且分组后样本更少,IQR/Z-score 的稳定性有限;它们不能推翻工程阈值,也不能把相关性写成根因。

23. 生成带单位、阈值、来源的图表与报告

要求图表的横轴/纵轴写单位,阈值线可见,候选有文字标签,颜色之外还有形状或标签,报告列出来源文件和筛选规则。图表帮助定位记录,不替代工程判断。

不要默认使用柱状图。先问“我要比较距离、过程、密度、优先级、分组还是流向”,再选图。下面八份提示词可以直接复制;如果当前数据不满足图形条件,Agent 必须说明原因并停止,不能补造数字。

Dumbbell Plot:比较实测值与阈值

适合看“差多少”,也是本文 PPTX 的工程图表形式。

只读 simulation-results.csv 和 simulation.log,保留原始文件。
分别为 latency_ns 与 power_mw 生成 Dumbbell Plot:每行一个 run_id,一端是实测值,另一端是工程阈值(8.0 ns / 50.0 mW),中间连线。
只显示工程阈值候选、统计型候选和必要的参考记录;说明筛选范围与样本数。
缺失值留空并用文字标记,精确重复只保留一条用于作图但报告重复事实。
写清单位、来源和候选原因;用点形、文字和数值区分,不只用颜色。
适配 390 像素宽:标签过密时改为分面或可横向滚动,不缩成不可读小字。
若两端不是同一指标/单位、没有可核实阈值或记录太多无法标注,停止并说明不适合;标题下写“候选,不等于故障”。输出后逐项与 CSV 核对。

Waterfall Chart:解释可相加的变化贡献

只在各步骤确实能相加到总变化时使用,例如整理时间从 95 分钟到 28 分钟的已核实分项。

先检查输入是否有同一单位、可相加且能对账到起点和终点的分项。
若没有分项,只报告“当前材料不足以制作 Waterfall Chart”,不要拆分或估算。
若条件满足,生成从基线到结果的 Waterfall Chart:标出起点、每项增减、终点、单位、来源文件和核对式。
先排除精确重复;任一分项缺失时停止,不填 0;工程阈值不适用于本图时明确写“不适用”。
增加文字标签与正负号,不只用颜色;适配 390 像素宽阅读;注明“本图解释已核实贡献,不判定异常或故障”。
输出后验证所有分项之和等于总变化;无法对账就停止,不输出图。

Heatmap:查看记录与信号的集中位置

本文 HTML 用它显示数据质量和候选信号,不表示故障概率。

只读 simulation-results.csv、simulation.log 和已核实报告。
行为 run_id,列为:精确重复、power_mw 缺失、延迟越线、功耗越线、error_count 非零、日志 WARN/ERROR、统计筛查信号。
只对有任一信号的记录生成 Heatmap;单元格只能来自可核实的布尔值或日志级别,不生成概率或综合分数。
列名写明原始单位/阈值(8.0 ns、50.0 mW、error_count=0);缺失与精确重复各自保留独立信号,不能填 0 或静默删行。
每格保留文字/符号,给出图例、样本范围、来源和“信号不是故障”的说明;390 像素宽允许横向分段或转为小表格,不只靠颜色。
如果不能把每格还原为布尔证据、阈值或日志级别,停止并改用明细表,不制作 Heatmap。

Pareto Scatter Plot:同时看两项指标的非支配关系

本文 HTML 用延迟与功耗的归一化值作图;它不包含错误计数或根因。

从 simulation-results.csv 的 29 个唯一 run_id 生成 Pareto Scatter Plot。
横轴为 latency_ns / 8.0,纵轴为 power_mw / 50.0,在两轴 1.0 位置画参考线;SIM-012 因功耗缺失不进入坐标,但要在图下注明。
标注工程阈值候选和统计型候选,用形状与文字区分;显示两个指标“越高越需复核”的 Pareto 前沿。
明确:前沿只表示这两个指标的非支配关系,不包含 error_count、日志级别、故障概率或根因。
列出来源、去重规则、缺失处理和样本数,标题下注明“候选,不等于故障”;适配 390 像素宽并用形状/文字而非只用颜色。
如果两轴单位/阈值无法归一化、方向含义不一致或有效记录不足,停止并说明不适合;输出后复算每个标注点坐标。

Lollipop Chart:强调少量排序后的值

从已核实数据中选择不超过 10 条需要人工复核的记录,说明筛选条件和未展示数量。
按同一指标排序生成 Lollipop Chart,轴写单位并画工程阈值;圆点旁显示 run_id 与数值,线只帮助定位。
缺失和重复按原规则处理,不把排名写成故障严重度。
使用文字/形状冗余编码,适配 390 像素宽,并列出来源和“候选,不等于故障”。
如果记录不是同一指标/单位、阈值未核实或超过 10 条仍无法清楚标注,停止并改用表格或 Small Multiples。

Small Multiples:按 corner 比较相同尺度

按 corner 把 latency_ns 或 power_mw 拆成 Small Multiples;所有小图必须使用相同坐标范围、单位和阈值。
先精确去重;缺失值留空并在对应分面注明,不填 0。每个小图显示样本数,标注工程阈值候选和统计型候选;不要用不同尺度夸大差异。
说明当前分组样本很少,图形只用于发现复核线索,不能证明温度、电压或 corner 是根因。
列出来源,使用相同点形/文字标签而非只靠颜色,并让 390 像素宽页面纵向排列分面;写“候选,不等于故障”。
若分组互斥性、统一单位/阈值或统一坐标范围无法保证,停止并说明不适合;输出后核对每个 run_id 只进入一个正确分组。

Sankey Diagram:表示材料流向而不是数值比较

只使用已核实的材料状态生成 Sankey Diagram:18 份输入 → 16 份已分类 + 2 份缺少责任角色;6 项计划交付物 → 5 项完成 + 1 项待复核。
两条不同口径的流不得在同一总量上相加;必要时拆成两个并列 Sankey。
先排除精确重复;缺失状态单独进入“未确认”节点,不填 0;工程阈值不适用于材料流时写“不适用”。
节点和连线写明数量、单位与来源,颜色之外保留文字;适配 390 像素宽,必要时改为两张纵向小图;注明“本图表示流向,不判定异常或故障”。
若任一流入不等于流出、节点不是同一守恒口径或路径交叉到无法手机阅读,停止并报告对账差异。

Bullet Chart:压缩展示实际值、目标和警戒线

为“已分类材料 16/18”和“已完成交付物 5/6”分别生成 Bullet Chart。
写明实际值、总量、目标、单位和来源;不要把 18 或 6 当成未经确认的行业基准。
精确重复只保留一项并报告重复事实;若展示延迟/功耗,实际值与工程阈值必须使用同一单位,缺失值不画成 0。
使用标记形状、文字和数值,不只用色带;适配 390 像素宽,注明“候选,不等于故障”,并在输出后逐项对账。
若目标/警戒线没有核实来源、实际值与阈值单位不同或无法处理缺失/重复,停止并说明不适合制作 Bullet Chart。

真实芯片工作的下一步可以是按 corner、温度、电压比较分布,关联日志上下文并给出优先复核顺序。真实网表、版图、波形和未公开数据必须留在组织批准的环境。

Goal、Subagent、Skill 与 MCP

24. 在同一任务中第一次安全使用

先定义 Goal:

目标:从三个虚构文本生成不超过 800 字的周报;数字有来源;不改输入;PPTX/HTML 只从核实文档派生;最终列出人工复核项。

需要时让一个 Subagent 只核对来源,另一个只检查版式;不要让两者修改同一文件。把反复使用的“来源核对、PPT 渲染、HTML 离线检查”写成 Skill。

MCP 只在确有外部数据需求时增加。第一次选本地、只读、范围限定的 MCP,确认它暴露哪些文件/工具;不要一开始连接公司数据库、邮箱或整块云盘。MCP 解决连接,不代表公司批准,也不证明经网关后的 MCP tool search 可用。

故障排查

25. 网络、地区、401/403/429、模型、余额、依赖和乱码

表格:现象 / 先查什么 / 不要马上做什么
现象 先查什么 不要马上做什么
命令不存在 安装、终端重开、PATH 粘贴不明修复脚本
网页/API 不通 当前网络、公司出口、官方状态和地区 用代理推断官方资格
401 Key、环境变量、端点、账号 公开完整 Key
403 地区、组织权限、产品资格、政策 反复换 IP 规避
429 余额、速率、并发、套餐时间窗 无限自动重试
模型不存在 /models 或官方当日模型名 照抄旧教程模型名
能聊天不能改文件 当前目录、工具权限、协议工具调用 给整个硬盘权限
MCP/Skill 失效 客户端支持、网关转发、配置范围 从文字回复推断兼容
乱码 文件编码、终端字体、CSV 分隔符 覆盖原文件试错
账单不对 当前 Key、Provider、模型、网关主体 继续批量运行

中国大陆与香港的网络可达性都可能随运营商和公司出口变化;官方地区、注册、付款与公司政策仍要独立核对。

最后检查

26. 密钥、费用、原始材料、事实与人工复核

结束前逐项打勾:

  • 已在 Provider 控制台查看实际模型、用量和账单;
  • 已撤销临时 Key,清除会话环境变量和不用的本机凭据;
  • 已按官方流程取消不需要的 pay-as-you-go 或套餐,并知道可能还有最终账单;
  • 五个输入文件未被覆盖,未向练习目录外写文件;
  • 文档、PPTX、HTML 的数字、日期、风险和异常候选与事实源一致;
  • HTML 断网可用、手机可读、无外部请求;PPTX 可编辑且渲染无溢出;
  • 所有统计异常只写成候选;真实工作结论由有权限的人复核。

预算提醒、速率限制和硬消费上限不是一回事。最可靠的成本控制仍是专用 Key、小任务、虚构输入、立即看用量、不用就撤销。

27. 回到知识地图

你已经走完一个真正的 Agent 闭环:限定目录 → 选择认证与模型 → 只读核对 → 生成新文件 → 回到事实源验证 → 检查账单并撤销。

以后遇到新的模型、Agent 或网关,回到《从聊天机器人到 Agent:一张 AI 知识地图》,按模型、API、客户端、工具、成果和人工复核重新定位,不必重新背一遍品牌名。

官方入口与核验说明

以下页面核验于 2026-08-17;按钮、价格、模型名、系统要求和地区列表以操作时的官方页面为准: