周五晚上十点,你瘫在沙发上。朋友群里弹出一条:明天去哪玩?
懒得一个个 App 翻,你打开 AI 打了一行字:"周末带俩朋友去哪玩,一人预算五百"。
屏幕上开始一个字一个字往外蹦。
就这几秒,背后跑完了一整套东西。那些你天天听见的名词,Token、Context、Prompt、Skill、Tool、MCP、Agent,全在这条线上。
跟着这句话走一遍,你就全懂了。
第一步 Token:你的话被切成了小块
AI 不是整句吞下去的,它眼里只有一小块一小块的东西,每一块叫一个 Token。
就像乐高,得先把句子拆成积木它才拿得动。"周末"是一块,"朋友"是一块,有时俩字才拼一块,怎么切它自己定。
![]()
第二步 Context:AI 其实没有记忆
你以为说了"俩朋友""预算五百",它记住了。不是的。它每次都把聊过的内容重新看一遍。
就像找人帮忙,得先把前情复述一遍:"上次说的那个事啊,后来又……"
你刚打的话、聊天记录、后台定的规矩,这些每次递过去的东西,加起来叫 Context(上下文)。
它是有上限的,叫上下文长度。平时听到的"支持 1M 上下文",说的就是这个。丢一份超长攻略进去,就装不下了。
![]()
第三步 Prompt:有两种提示词
你那句"周末带俩朋友去哪玩",叫 User Prompt(用户提示词)。
还有一层你看不见的:产品后台提前写好的规矩,比如"回答要贴心,多给几个选项,别替用户拍板",这就是 System Prompt(系统提示词)。
一个是顾客点的菜,一个是厨房的规章。
前几年很火的提示词工程,说到底也就是把话说清楚。
第四步 LLM:它其实只会接话
底层的大模型,全名叫 Large Language Model,就是 LLM。
它的本事很朴素:根据前面的内容,猜下一个最可能出现的词。猜一个接一个,像玩文字接龙。
你感觉它在聊天,本质上是它接话接得太像了。
![]()
幻觉:它会一本正经地瞎编
它只管接得像不像,不管说得对不对。
你问它"附近哪家店好吃",它可能报出一家压根不存在的店,还有模有样编个地址。
这叫幻觉。记住一条:语气笃定不等于事实,要紧的事自己再核一遍。
多模态:它还能看图
你发过去一张朋友想去的景点截图,它看得懂。
早些年的大模型只认字,现在很多能看懂图、听懂声音,甚至看视频。这就叫多模态。
第五步 Tool:它只有嘴,没有手
它再会接话也只是在说,没法真帮你干活。
你问它周末天气,它自己查不了,只会说"你可以打开天气 App 看看"。
要让它真能干,就得给它装上手,这就是 Tool(工具)。
工具不是它自带的。背后得有人搭个桥,把你的问题、能用哪些工具一起递过去,它挑一个,桥替它调用、再把结果拿回来。这一套就叫工具调用。
![]()
第六步 MCP:接口太乱,于是有了统一插座
麻烦在于,每家工具的接入方式都不一样。
查天气的工具来自一家,地图工具来自另一家,接进 AI 时各写一套代码。
于是有人定了套统一标准,叫 MCP。
你可以把它想成 Type-C 接口。插口统一了,一个工具写一次,哪家都能用。
第七步 Agent:从会说话,到会办事
到这儿还差一步:工具摆在那儿,得会自己安排着用。
Agent(智能体)干的就是这个:自己规划、自己挑工具、一步步做下去,直到把事办完。
比如你要一份周末方案,它不是甩给你十个景点,而是自己排好:
中间不用你催。
Claude Code、Codex 这些,都是 Agent。
![]()
第八步 Agent Skill:每次都教一遍太累
要是每周都这么问一次,每次都得重新交代,烦。
于是有了 Agent Skill,一份写给 AI 看的说明书。
把规划周末这个活写清楚:先问预算、再查天气、给三个方案、避开太远的。存好放在指定位置,下次你说一句"按老规矩来",它自己翻出来照做。
串起来看
周五晚上那行字,背后是这样的:
你的话 → 被切成 Token → 和聊天记录一起打包成 Context → 模型(LLM)接着往下猜 → 需要干活就调用 Tool → 工具按 MCP 标准接入 → 由 Agent 自己规划着一步步做完 → 复杂流程提前写好 Agent Skill 给它照做。
![]()
跑完这一整套,几秒钟。Claude Code、Codex、各种 AI 助手,底层跑的都是这一套。
喜欢本文,关注、长按点赞一键三连哦~
你有哪些 AI 名词分享?评论区聊聊
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
