图像token的详细理解
📅 2026/7/22 12:56:02
👁️ 次浏览
在深度学习中token是指文本或图像中的最小单位。在自然语言处理NLP中token 通常是一个单词、字符或子词而在计算机视觉CV中token 则是图像切割后的小块(patch)。先导知识Token在自然语言处理中的应用在 NLP 中tokenization 是将文本分割成更小的单位token的过程。例如句子 Never give up 可以被分割成三个单词 tokenNever、give 和 up。此外token 还可以是字符或子词例如 smarter 可以被分割成字符 tokens、m、a、r、t、e、r或者子词 tokensmart 和 er。中文把经常出现的词高频词看作一个token。好处把文本token化了计算量变小了。例子我喜欢玩-------------------------我喜欢玩token解析如果以单个字拆分有4个。如果以token来拆分有3个token.计算token的网址Tiktokenizerhttps://tiktokenizer.vercel.app/在大型语言模型中token 是模型处理文本的基本单位。模型接收一串 token 作为输入并尝试预测下一个最可能的 token。为了提高处理速度和减少内存占用通常使用特定的 tokenization 方法如字节对编码BPE或 WordPiece。1.图像的token1图片切换1把图片切成小方块patch)想象一下你有一张512×512像素的图片。Qwen3-VL不会直接看整张图而是像切豆腐一样把它切成很多14×14像素的小方块patch。1个patch 14×14196个像素。计算一下512÷14≈36.57向上取整为37。所以横竖各37个patch总共37×371369个patch。2.每个patch转换为向量现在我们有1369个小方块但模型看不懂方块需要把每个方块变成数字向量。输入Patch 1 (14×14×3的RGB像素值)步骤1Flatten 14×14×3 588个数字步骤2Linear Projection (线性投影)##Linear(588,1280)输出变成一个向量: [0.23, -0.15, 0.88, ..., 0.05] 维度: 1280 (hidden_dim)即特征向量的长度是1280.这个过程叫Patch Embedding本质上是一个卷积层Conv2d在做这件事# 伪代码patch_embed Conv2d(in_channels3, # RGB三通道out_channels1280, # 输出维度kernel_size14, # 14×14的卷积核stride14 # 步长14不重叠)此时数据形状输入:[batch_size, 3, 512, 512]输出:[batch_size, 1369, 1280]batch_size是同时处理几张图1369是patch数量1280是每个patch的向量维度。2patches变为token现在我们有了1369个向量但这还不是最终的token。直接把这1369个向量当token用行不行不行太多了 1369个token太占计算资源需要进一步压缩。1关键操作PatchMerger2×2合并Qwen3-VL用了一个叫PatchMerger的模块把2×2相邻的4个patch合并成1个token。相邻4个patch合并为1个token1369➗4342.5具体怎么合并不是简单的取平均而是用一个可学习的神经网络层把4个向量融合成1个向量# 伪代码PatchMergerdef merge_2x2(patches):# patches: [batch, 37, 37, 1280]# 把2×2的格子分组grouped reshape(patches, [batch, 18, 18, 4, 1280])# 4个patch的特征拼在一起: 4×12805120维# 用线性层压缩回1280维merged Linear(5120, 1280)(grouped)return merged # [batch, 18, 18, 1280] [batch, 324, 1280]此时数据形状输入:[batch_size, 1369, 1280]输出:[batch_size, 324, 1280]324≈1369/42每个token覆盖多大区域原始图片: 512×512 像素PatchEmbed (14×14): 1369个patchPatchMerger (2×2合并): 324个token每个token覆盖: 28×28 像素 (14×2)###########2×2个patch合并为一个token实际等效: 约32×32 像素/token (因为取整和padding)这就是为什么Qwen3-VL的token计算公式是32×32的原因3 图片 → Token 的完整流程现在我们把整个流程串起来看看一张图片是怎么一步步变成token序列的.。1完整流程2.Token数计算公式总结对于一张 H×W 像素的图片1 预处理调整为32的倍数H ceil(H/32) × 32W ceil(W/32) × 322计算Token数num_tokens (H/32) × (W/32) 22 是 |vision_bos| 和 |vision_eos|3 如果超过max_pixels (默认8,388,608像素)先等比例压缩再计算举几个例子512×512图片: (512/32)×(512/32)2 16×162 258 tokens1920×1080图片: (1920/32)×(1080/32)2 60×33.75→60×342 ≈ 2042 tokens4K图片 (3840×2160): 超过8,388,608先压缩到约3552×2368然后→ 约8194 tokens写在最后所以图片算token数的本质是切分把图片切成14×14的小块patches嵌入每个patch变成1280维的向量合并2×2的patches合并成1个visual token约32×32像素标记加上BOS和EOS特殊token拼接和文本token拼在一起输入LLM应用Token化模型常用的token化模型包括CNN、Transformer和MLP等这些模型将原始图片压缩成维度更低的序列向量。
如何用开源方案破解音乐版权困局:LX Music聚合音源深度解析 【免费下载链接】lxmusic- lxmusic(洛雪音乐)全网最新最全音源 项目地址: https://gitcode.com/gh_mirrors/lx/lxmusic-
你是否曾为了一首歌在不同音乐App之间来回切换?是否因为某个平台…
📅 2026/7/20 8:42:41
三步配置法:国家中小学智慧教育平台电子课本批量下载方案 【免费下载链接】tchMaterial-parser 国家中小学智慧教育平台 电子课本下载工具,帮助您从智慧教育平台中获取电子课本的 PDF 文件网址并进行下载,让您更方便地获取课本内容。 项目地…
📅 2026/7/20 13:49:31
1. 汽车网关的核心作用与设计挑战在当今的智能汽车架构中,网关控制器扮演着"神经系统中枢"的角色。我经手过的十几个车型项目里,网关要处理的任务从简单的CAN信号转发,到复杂的以太网协议转换,再到整车OTA升级的流量调度…
📅 2026/7/20 22:02:19
GraphPipe最佳实践:生产环境部署的10个关键步骤 【免费下载链接】graphpipe Machine Learning Model Deployment Made Simple 项目地址: https://gitcode.com/gh_mirrors/gr/graphpipe
GraphPipe是一个旨在简化机器学习模型部署的强大工具,它解决…
📅 2026/7/22 19:43:52
Statistics模块实战:用MathGenerator生成符合教学大纲的统计题目 【免费下载链接】mathgenerator A math problem generator, created for the purpose of giving self-studying students and teaching organizations the means to easily get access to high-quali…
📅 2026/7/22 19:43:52
1. 项目概述:ThinkGen如何重新定义AI创作流程ThinkGen这个开源项目最近在GitHub上引发了热烈讨论,它从根本上改变了传统AI直接输出的工作模式。作为一个长期跟踪AI技术发展的从业者,我第一时间下载并测试了这个框架,发现它确实解决…
📅 2026/7/22 19:42:52
存货周转天数手工算到崩溃,你是不是也这样?前阵子跟一位在零售行业做财务经理的朋友吃饭,她整个人看起来憔悴了不少。一问才知道,季度经营分析会马上要开了,光一个存货周转天数就让她们团队折腾了整整四天。仓库系统导…
📅 2026/7/22 19:42:52
Jellium Desktop窗口透明度调整:打造个性化视觉体验 【免费下载链接】jellium-desktop An unofficial desktop client for Jellyfin 项目地址: https://gitcode.com/GitHub_Trending/je/jellium-desktop
Jellium Desktop作为一款非官方的Jellyfin桌面客户端&…
📅 2026/7/22 19:42:52
DPPO自定义数据集教程:打造专属机器人控制训练数据的完整流程 【免费下载链接】dppo Official implementation of Diffusion Policy Policy Optimization, arxiv 2024 项目地址: https://gitcode.com/gh_mirrors/dpp/dppo
DPPO(Diffusion Policy …
📅 2026/7/22 19:42:52
1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…
📅 2026/7/22 0:00:13
1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…
📅 2026/7/22 0:00:13
甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…
📅 2026/7/22 0:00:13
1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…
📅 2026/7/22 1:05:21
1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…
📅 2026/7/22 1:05:21
更多请点击:
https://intelliparadigm.com
第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…
📅 2026/7/22 1:05:21
目录
第一步:选对模板,省心一半
第二步:打开扫码点餐功能
开启功能按钮
桌台管理与桌码生成
第三步:个性化设计,打造品牌感
调整点餐页面
设置点餐规则 你还在让顾客站着排队点餐吗?2025年ÿ…
📅 2026/7/22 7:05:39
在业务中快速构建一个能理解私有文档、准确回答专业问题的智能助手,是很多开发团队面临的共同挑战。传统方案往往需要从零开始搭建复杂的 RAG(检索增强生成)系统,涉及文档解析、向量化、检索、大模型调用等多个环节,整…
📅 2026/7/22 17:06:14
FAE放射组学分析工具:医学影像特征探索的完整解决方案 【免费下载链接】FAE FeAture Explorer 项目地址: https://gitcode.com/gh_mirrors/fae/FAE
你是否曾经面对海量医学影像数据感到无从下手?想要从CT、MRI等影像中提取有价值的定量特征&#…
📅 2026/7/22 5:05:32