天天听人说Token、Skill、Agent、多模态,到底是啥?AI名词解释

周五晚上十点,你瘫在沙发上。朋友群里弹出一条:明天去哪玩?

懒得一个个 App 翻,你打开 AI 打了一行字:"周末带俩朋友去哪玩,一人预算五百"

屏幕上开始一个字一个字往外蹦。

就这几秒,背后跑完了一整套东西。那些你天天听见的名词,Token、Context、Prompt、Skill、Tool、MCP、Agent,全在这条线上。

跟着这句话走一遍,你就全懂了。

第一步 Token:你的话被切成了小块

AI 不是整句吞下去的,它眼里只有一小块一小块的东西,每一块叫一个 Token

就像乐高,得先把句子拆成积木它才拿得动。"周末"是一块,"朋友"是一块,有时俩字才拼一块,怎么切它自己定。

第二步 Context:AI 其实没有记忆

你以为说了"俩朋友""预算五百",它记住了。不是的。它每次都把聊过的内容重新看一遍

就像找人帮忙,得先把前情复述一遍:"上次说的那个事啊,后来又……"

你刚打的话、聊天记录、后台定的规矩,这些每次递过去的东西,加起来叫 Context(上下文)。

它是有上限的,叫上下文长度。平时听到的"支持 1M 上下文",说的就是这个。丢一份超长攻略进去,就装不下了。

第三步 Prompt:有两种提示词

你那句"周末带俩朋友去哪玩",叫 User Prompt(用户提示词)。

还有一层你看不见的:产品后台提前写好的规矩,比如"回答要贴心,多给几个选项,别替用户拍板",这就是 System Prompt(系统提示词)。

一个是顾客点的菜,一个是厨房的规章。

前几年很火的提示词工程,说到底也就是把话说清楚

第四步 LLM:它其实只会接话

底层的大模型,全名叫 Large Language Model,就是 LLM

它的本事很朴素:根据前面的内容,猜下一个最可能出现的词。猜一个接一个,像玩文字接龙。

你感觉它在聊天,本质上是它接话接得太像了。

幻觉:它会一本正经地瞎编

它只管接得像不像,不管说得对不对。

你问它"附近哪家店好吃",它可能报出一家压根不存在的店,还有模有样编个地址。

这叫幻觉。记住一条:语气笃定不等于事实,要紧的事自己再核一遍。

多模态:它还能看图

你发过去一张朋友想去的景点截图,它看得懂。

早些年的大模型只认字,现在很多能看懂图、听懂声音,甚至看视频。这就叫多模态

第五步 Tool:它只有嘴,没有手

它再会接话也只是在说,没法真帮你干活

你问它周末天气,它自己查不了,只会说"你可以打开天气 App 看看"。

要让它真能干,就得给它装上手,这就是 Tool(工具)。

工具不是它自带的。背后得有人搭个桥,把你的问题、能用哪些工具一起递过去,它挑一个,桥替它调用、再把结果拿回来。这一套就叫工具调用

第六步 MCP:接口太乱,于是有了统一插座

麻烦在于,每家工具的接入方式都不一样。

查天气的工具来自一家,地图工具来自另一家,接进 AI 时各写一套代码。

于是有人定了套统一标准,叫 MCP

你可以把它想成 Type-C 接口。插口统一了,一个工具写一次,哪家都能用。

第七步 Agent:从会说话,到会办事

到这儿还差一步:工具摆在那儿,得会自己安排着用。

Agent(智能体)干的就是这个:自己规划、自己挑工具、一步步做下去,直到把事办完

比如你要一份周末方案,它不是甩给你十个景点,而是自己排好:

中间不用你催。

Claude Code、Codex 这些,都是 Agent。

第八步 Agent Skill:每次都教一遍太累

要是每周都这么问一次,每次都得重新交代,烦。

于是有了 Agent Skill一份写给 AI 看的说明书

把规划周末这个活写清楚:先问预算、再查天气、给三个方案、避开太远的。存好放在指定位置,下次你说一句"按老规矩来",它自己翻出来照做。

串起来看

周五晚上那行字,背后是这样的:

你的话 → 被切成 Token → 和聊天记录一起打包成 Context → 模型(LLM)接着往下猜 → 需要干活就调用 Tool → 工具按 MCP 标准接入 → 由 Agent 自己规划着一步步做完 → 复杂流程提前写好 Agent Skill 给它照做。

跑完这一整套,几秒钟。Claude Code、Codex、各种 AI 助手,底层跑的都是这一套。

喜欢本文,关注、长按点赞一键三连哦~

你有哪些 AI 名词分享?评论区聊聊

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com