转载-Ai是怎么诞生的?Ai所用的Token到底是什么?和其它Token有什么区别?
Ai发展历程
自上世纪40-50年代,科学家们就奠定了“机器能否思考”这一根本问题的理论和概念基础
1943年:神经生理学家麦卡洛克和数学家皮茨提出了人工神经网络的数学模型,为后来的深度学习播下了种子。
1950年:被誉为“AI之父”的艾伦·图灵提出了著名的图灵测试,首次为判断机器智能提供了一个可操作的标准
1956年:在达特茅斯会议上,约翰·麦卡锡正式创造了 “人工智能 (Artificial Intelligence)” 这一术语,这被公认为AI作为一门独立学科的诞生标志。会上还展示了被认为第一个AI程序的“逻辑理论家”(Logic Theorist)。
AI诞生后,科学家们欣喜若狂,但很快便遭遇了瓶颈。
1956-1974这几年,是Ai的黄金时代,这一时期的主导是符号主义,认为智能的核心是逻辑推理。期间诞生了感知机(神经网络的早期模型)和ELIZA艾丽莎(早期聊天机器人)等成果。当时的预言极其乐观,比如西蒙在1958年预测“十年内计算机将战胜国际象棋冠军”。
直到1974年,由于计算能力不足,且被证明连简单的“异或”(XOR)问题都无法解决,AI研究陷入困境。英美等国政府大幅削减经费,导致研究进入低谷。
1980年-1987年,专家系统的兴起带来了第二次浪潮。这类系统通过模拟特定领域专家的知识进行推理,在化学分析(DENDRAL)和医学诊断(MYCIN)等方面取得商业成功。
好景不长,1987年,专家系统维护成本高昂、能力有限,加之当时更通用的个人电脑兴起,商业市场迅速萎缩,AI研究再次进入低谷。
1993-2011年,这是一个相对平稳但技术持续积累的时期,AI的研究重心开始从“规则”转向“数据”
1997年:IBM的超级计算机“深蓝” 战胜国际象棋世界冠军卡斯帕罗夫,是AI在复杂智力游戏中的里程碑。
反向传播算法的重新发现、支持向量机(SVM)和卷积神经网络(CNN)等算法的提出与完善,为深度学习的爆发做好了理论准备。
2006年,英伟达推出CUDA平台,让GPU可用于通用计算,为后续深度学习所需的强大算力奠定了基础。
2012年,AlexNet在ImageNet图像识别大赛中以压倒性优势夺冠,正式开启了深度学习的时代。
2016年,谷歌的AlphaGo击败围棋世界冠军李世石,向世界展示了AI在复杂策略游戏中的惊人能力。
2017年,谷歌提出 Transformer架构,成为当今几乎所有大型语言模型(LLM)的基础。
2020年至今,以GPT-3和ChatGPT为代表的生成式AI爆发,使AI具备了强大的内容生成能力。
2024年,Sora等文本生成视频模型的出现,进一步拓展了AI的创造边界。
2012至今,这是AI发展最为迅猛的阶段,以深度学习为代表的第三次浪潮席卷全球
什么是Token?
Token目前可用于四个方面,一是Ai大模型,一个是登录认证,一个是区块链/加密货币中的Token(代币),最后一个则是编程语言编译原理中的Token(词法记号)
AI大模型中的Token(分词单元)
这是目前90%的人问“Token”时的真正意图。它本质上是大模型处理文字的“基本货币单位”。
1. 大模型为什么要切分,而不是直接读整句?
因为大模型的神经网络(Transformer架构)有固定的“注意力窗口”(Context Window)。它不能像人一样一眼扫完《红楼梦》,必须把文字切成小块,一块一块地“吃”进去并行计算。这个最小块就是Token。
2. 到底怎么切的?
切分不是按空格,而是用算法(如BPE或WordPiece)统计高频组合:
-
英文:比较友好。
“Hello world!”通常被切成["Hello", " world", "!"]→ 约3个Token。常见单词占1个,罕见长单词会被拆成词根词缀。 -
中文:比较“费钱”。因为字符集巨大,分法取决于模型厂商的词库。
-
常用词:
“你好”可能被视作一个高频整体 → 1个Token。 -
生僻字/罕见词:
“魑魅魍魉”每个字都可能被拆开 → 4个Token。 -
官方换算参考:在DeepSeek/OpenAI的通用分词器下,1个汉字 ≈ 1.5 ~ 2个Token。也就是说,你给AI发一篇 1000字的稿子,大概消耗 1500~2000个Token。
-
3. Token限制到底卡在哪里?
比如模型写着“上下文1M(百万)Token”,意思是它一次能记住约 70万~80万个汉字(相当于《三体》三部曲的总和)。一旦你的历史对话总Token数超过这个值,模型就会“失忆”——它会把最早的那部分对话“挤出去”忘掉,哪怕你发新消息追问,它也不记得开头聊了什么。
4. 为什么输入少,扣费却感觉多?
因为大模型计价包含 提示词(输入) + 回答(输出) 的总和。而且很多平台还有额外隐形消耗:
-
系统提示词(System Prompt)虽然你看不见,但它每次都默默占用几百Token。
-
函数调用(Function Calling)的工具描述也会占Token。
-
长对话的历史记录会持续累积,随着聊天变长,单次请求的Token消耗会指数级飙升。
计算机登录认证中的Token(访问凭证)
如果你是在写前端代码、调API接口或抓包时看到Token,那它指的是“数字版临时身份证”。
1. 它解决了什么痛点?
早期用 Session(会话) 时,服务器得存一份所有用户的登录状态(占用内存)。用户多了服务器扛不住,且移动端不兼容。
Token方案是服务端无状态的:服务器只管“签发”和“验证签名”,不存储你的登录信息,完美解决了扩容问题。
2. 最常见的Token长什么样?
你现在最常见的Token是一串很长的乱码,通常遵循 JWT(JSON Web Token) 标准。它由三部分组成,用点.隔开:
-
Header(头部):声明加密算法(如HS256)。
-
Payload(载荷):核心区域,明文Base64编码存着你的用户ID、昵称、过期时间(Exp)。注意:这部分只是编码,不是加密,千万别把密码放进去,谁都能解码出来看。
-
Signature(签名):由前两部分 + 服务器秘钥 算出的防伪标识。只要有人篡改Payload,签名就对不上,服务器直接拒绝。
3. 致命的有效期问题
-
Access Token(访问令牌):有效期极短(通常 15分钟 ~ 2小时)。为什么?防止Token被别人偷走后永久冒充你。
-
Refresh Token(刷新令牌):有效期很长(几天甚至数月)。它唯一的用途是:当Access Token过期时,拿着Refresh Token去换一张新的Access Token,而不需要用户重新输密码。
-
流程:登录 → 发给你两个Token(Access短 + Refresh长)→ 日常请求只用Access → 过期了自动拿Refresh换新 → 换新失败则跳回登录页。
4. 前端到底把Token存哪?
-
localStorage:方便,但有XSS(跨站脚本攻击)风险,黑客的一行恶意JS就能把你的Token偷走。
-
Cookie(HttpOnly):安全(JS无法读取),但有CSRF(跨站请求伪造)风险,需配合SameSite属性。
-
业界最佳实践:对于敏感后台,通常用 HttpOnly Cookie 存Token,配合CSRF-Token双管齐下;对于手机APP,则存在加密的Keychain中。
区块链/加密货币中的Token(代币)
如果聊的是炒币或Web3,这里的Token指可编程的数字资产。
-
与Coin的区别:Coin(如比特币、以太坊)拥有自己独立的底层公链;而Token(如USDT、UNI、SHIB)是寄生在现有公链(如以太坊)上的智能合约。你可以简单理解为:Coin是“盖房子的地基”,Token是“在房子里开的超市”。
-
分类:支付型(如USDT稳定币)、治理型(持有者可投票决定项目走向)、权益型(代表某种实物资产或分红权)。
编程语言编译原理中的Token(词法记号)
如果你在大学上《编译原理》课,Token是词法分析器(Lexer)吐出的结果。
-
当你写代码
int age = 18;时,词法分析器会忽略空格,把它拆成一个个不可再分的语法原子:int(关键字)、age(标识符)、=(赋值符)、18(数字常量)、;(分界符)。这五个就是Token。 -
解析器(Parser)会根据这串Token流,构建出语法树(AST),决定代码要怎么执行。
文章信息可能并非专业解答,如有问题,请联系lruriawa@lruriawa.top进行修改。
本文转自Aurora.歆の小破站,转自己家的,版不版权无所谓了