
做企业创新这块的实证研究这两年我感触最深的一件事就是模型和计量方法只要肯花时间基本都能学会真正卡脖子的其实是数据。尤其当你研究对象是瞪羚企业、独角兽这类高成长主体时公开数据库里根本没有一本现成的花名册等着你去查专利。我前后折腾了将近一年把1985年到2024年跨度接近四十年的专利申请与授权数据跟三类科技型企业的名单逐一匹配最后整理成一套企业-年度面板数据。今天这篇就把整个构建过程的思路、口径、操作链路和踩过的坑一次讲清楚想直接拿这套逻辑去做类似数据集的或者已经在用类似数据做研究的应该都能从这里找到点东西。先说清楚这套数据到底是什么它的观察单位是企业时间维度是1985到2024年主体覆盖瞪羚企业、独角兽企业和科技型初创企业变量核心是这些企业历年申请和获授权的关键数字技术专利数量。也就是说它既包括了“申请量”和“授权量”两套口径也区分了总量和数字技术相关量。对做创新经济学、企业成长、产业政策评估的人来说这种结构最大的好处是拿过来就可以跑回归不需要再自己做痛苦的底层匹配。1. 为什么要盯住这三类企业它们恰好构成一条完整的成长阶段链条很多人看到“瞪羚、独角兽、科技型初创”这三个词容易把它们当成并列的三种身份实际上它们更像企业成长周期里的三个连续阶段。理清这层关系是理解整个数据设计逻辑的前提。1.1 三类企业的本质差异不是规模而是成长速度和中签率科技型初创企业是最大的基数池泛指处于早期阶段、以技术研发和科技成果转化为核心的小微企业。它们的特点是数量庞大、存活率低但凡是后来跑出来的瞪羚或独角兽几乎无一例外都从这个池子里诞生过。瞪羚企业最核心的识别特征是高速增长成立时间不长营收或就业规模在连续几个年度里保持两位数甚至更高的增长率。学术界通常借鉴德勤和考夫曼基金会那套对瞪羚的界定逻辑国内实践中则常采用“成立不超过10年、近三年营收复合增长率超过20%”这类具体化标准。独角兽则更稀缺指的是成立不超过10年、估值达到10亿美元以上且尚未上市的创业公司。从数量级上你就能感受到这条链条的漏斗形状科技型初创可能有几十万家瞪羚企业每年评选出几百到上千家独角兽全市场同期存量通常也只有一百多家。1.2 专利数据正好是观察这个成长链条的最佳切片为什么要选择一个同时覆盖三者的口径因为如果只盯独角兽你看到的是已经站在山顶的企业看不到它们在早期阶段的创新积累如果只盯科技型初创数据里又混杂了太多一直没有长大的企业噪声很大。把三者放在一起再用数字技术专利作为每个年度每个企业的“创新状态标记”我们就能回答一系列非常有价值的问题一家企业从初创成长为高成长企业的过程中数字技术专利是提前布局还是同步扩张不同阶段的专利申请倾向发明专利为主还是外观、实用新型为主是否发生了系统性变化授权率在哪个成长阶段最高这些问题的答案必须靠面板数据才能给出截面数据天然无能为力。1.3 “关键数字技术”这个限定词让数据具备稀缺性如果只是统计全部专利数据构建难度会降低很多但研究的辨识度和价值也会明显打折。关键数字技术对应的是数字经济这条主赛道包括人工智能、大数据、云计算、区块链、物联网、工业互联网等方向。对这类技术的专利做单独识别意味着你可以将企业的数字化转型行为和专利行为挂钩更精确地衡量企业在前沿数字技术方向上的真实投入。这也正是我在这套数据里把专利拆成“全部专利数”和“数字技术专利数”两个维度分别统计的原因——没有这一步拆分后续研究者就难以做差分式的比较分析比如数字技术专利对企业成长的速度是否显著高于非数字技术专利。2. 企业名单识别榜单数据、官方数据库和人工核验的三角验证构建面板数据的第一步不是查专利而是先确定“哪些企业要进样本”。这一步如果做不扎实后面所有匹配工作都是白费。三类企业的完整名单不可能从单一渠道拿到必须多渠道整合。2.1 瞪羚企业的名单来源与筛选口径国内瞪羚企业的主流名单渠道包括长城战略咨询每年发布的瞪羚企业报告、部分省市科技管理部门公开的瞪羚企业培育名单以及一些高新区自行评选的瞪羚名单。实际操作中我建议以省级科技厅发布名单为主以第三方机构榜单为辅因为政府背景名单在企业工商信息可查性上通常更友好后续匹配工商注册信息的成功率更高。值得提醒的是各省对瞪羚的认定标准并不完全统一有的要求近两年营收复合增长率不低于20%有的要求不低于25%且上年度营收不低于某一绝对额。做面板数据的前提是把这些标准在备注字段里记录清楚。由于部分企业可能在不同年份重复上榜去重时必须保留“首次上榜年份”和“上榜次数”两个衍生变量这为后续做事件分析比如认定政策的影响留下了空间。2.2 独角兽企业的名单抓取与时间维度拼接独角兽名单的渠道相对集中胡润全球独角兽榜、长城战略咨询独角兽榜单、IT桔子和清科数据库都有各自版本。麻烦的地方在于不同榜单行业覆盖范围、估值计算口径甚至企业名称写法都可能不同。比如同样是“XX科技北京有限公司”一个榜单写作“XX科技”另一个写作“XX科技有限公司”直接字符串匹配会丢数据。我当时采用的办法是先把历年所有渠道的名单全部汇总基于企业全称做精确匹配无法精确匹配的通过统一社会信用代码回补再剩下的就人工筛查。独角兽还有一个特殊问题企业一旦上市就退出榜单所以名单里还要注明企业上市年份和是否仍在独角兽序列中否则面板数据在时间维度上会出现明显断档。2.3 科技型初创企业的识别思路官方入库名单高新技术企业名单科技型初创企业这个口径最难界定因为“初创”和“科技型”都不是单一时间点上的静止属性。相对来说最规范、可复现的做法是使用科技型中小企业评价系统的入库名单。这套名单每年由各省级科技主管部门组织评价入库包含企业的注册时间、职工人数、研发投入占比等结构化信息。需要说明的是入库名单每年都在更新有的企业某年入库、某年退出所以匹配时应以“企业在某一年是否处于入库状态”为观测口径而不是只要历史上入过库就一直算作样本企业。如果研究对成长性有额外要求可以把高新技术企业认定名单也作为补充来源两者取并集、分别打标签这样后续做稳健性检验时可以有不同子样本切换。三类企业的识别口径差异不小我在下面把这个表总结出来了实际使用时可以直接按这个框架去落实。企业类型核心识别标准常见名单来源面板数据中的处理要点科技型初创企业成立时间短、科技型中小企业入库全国科技型中小企业入库名单、省市级科技主管部门以年度入库状态为准记录入库与退出年份警惕存续偏误瞪羚企业成立≤10年营收复合增长率≥20%省级瞪羚企业名单、长城战略咨询瞪羚报告去重时保留首次上榜年份和连续上榜次数独角兽企业成立≤10年估值≥10亿美元、未上市胡润榜单、长城战略咨询、IT桔子记录上市年份与退出榜单年份不同榜单一并核对3. 数字技术专利的识别IPC分类号和关键词必须组合使用企业名单确定之后下一步就是决定如何在几千万条专利数据里把“关键数字技术专利”捞出来。这个环节的策略直接决定了你统计的每个数字是否站得住脚也是最容易被人诟病“一把尺子量所有行业”的地方。3.1 为什么只看IPC分类号远远不够专利题录数据里的IPC分类号是审查员按技术领域划分的早期国内研究者识别数字技术专利时常用G06F电数字数据处理、H04L数字信息传输这类分类号做粗筛。但只靠分类号有两个明显短板第一数字技术的边界在快速外延近十年人工智能、区块链相关专利大量分布在G06N基于特定计算模型的计算机系统、G06Q商业、金融数据处理系统甚至H04W无线通信网络分类号下面单一分类号很容易漏第二一件专利会同时被赋予多个分类号其中主分类号和其他分类号的主次关系不同粗筛时如果不设定规则就可能重复计数或者属性错标。我踩过的比较浅的弯路是早期版本只用了主分类号结果大量跨界数字技术专利被漏掉后来改成“主分类号或副分类号命中任一即可”统计口径才趋于合理。3.2 分类号关键词组合识别框架的搭建为了让识别结果既覆盖得全又不过度泛化我最终采用的是“分类号粗筛关键词细筛”的两阶段识别策略。第一阶段用一组较宽的IPC分类号把所有可能涉及数字技术的专利全部捞出来第二阶段在专利标题和摘要文本中做关键词匹配剔除掉分类号命中但实际技术内容并非数字技术的专利。这里的现实问题是关键词清单的制定没有唯一标准答案需要结合研究的边界来设置我以人工智能、大数据、云计算、物联网、区块链、5G/6G通信、数字孪生、工业互联网这几个方向为核心分别整理每一类技术对应的中英文关键词词表。关键词编码上要特别注意同义词和大小写形式“AI”“artificial intelligence”“智能”“数据”“digital”都是基础项而像“区块链”对应的英文表达有blockchain、distributed ledger等必须全部覆盖。3.3 申请口径与授权口径的时序差异识别出专利之后第二个绕不开的统计问题是申请年份和授权年份怎么取舍。专利申请日是企业最早主张技术权利的时间点也是企业在创新活动上真实投入的近似节点授权日是专利通过审查获得法律保护的时间点更接近“创新成果得到认证”的时点。两者之间通常存在一到三年的审查周期发明专利平均审查周期比实用新型和外观设计长得多。我的处理方式是分别在面板里生成两套变量按申请日统计的申请量、按授权日统计的授权量同时额外生成一件专利“申请到授权的时间间隔”这个变量备用。这样既能满足习惯用申请量的研究设计也能满足习惯用授权量的稳健性检验需求而且在计算授权率这类衍生指标时也能清楚说明滞后结构。需要额外提醒的是专利数据里还有法律状态和“是否有效”两个维度。同一天申请的专利有的授权后维持有效有的中途因未缴年费失效有的被无效宣告或者被撤回。如果研究关注的是企业“有效技术存量”就必须在法律状态上做进一步筛选不能笼统地把所有授权专利都记成有效数字。我当时因为偷懒第一版只用“授权量”字段后面做稳健性检验时才发现失效专利占比并不低不同行业差异还很大这才回头补了法律状态的清洗步骤。4. 企业-专利匹配的链路从名称标准化到长面板拼接的完整流程这是整个数据库建设环节里工作量最大、也最容易出错的一步。企业名单是一套体系专利申请人名称又是另一套体系两边几乎没有完全统一的命名规范中间必须做一层精细的清洗匹配。4.1 企业名称标准化与历史名称变更处理申请表里的申请人名称五花八门比如“华为技术有限公司”和“华为终端有限公司”是两家不同主体不能合并而同一家企业在不同时期可能叫“XX网络科技有限公司”和“XX科技有限公司”这又是需要合并的历史名称变更。我的处理流程分四步第一步用工商注册信息里统一社会信用代码作为精确锚点第二步针对没有统一社会信用代码的老专利1985-2000年间大量专利数据里根本没有申请人代码使用企业全称精确字符串匹配第三步匹配不上的通过地址、法人、注册地等多维相似度做模糊匹配相似度阈值我设为0.85低于这个值的一律人工复核第四步对存在历史名称变更的企业建一张企业曾用名映射表把所有曾用名对应的专利归并到最新名称的无聊下同时保留曾用名生效年份区间方便追溯。这里要特别说明一个时间维度的坑1985年是专利法正式实施的第一年1990年代之前企业名称普遍带有明显的“厂矿色彩”例如“地方国营XX厂”或者带上“中国XX集团XX厂”这类前缀。这类名称与后来的有限公司名称逻辑差异很大如果直接套用现代企业名称清洗规则容易把同一主体拆成多个主体。稳妥的办法是专门对2000年以前的专利记录做一轮单独的名称回溯宁可慢一点也要人眼过一遍不能全流程自动处理。4.2 匹配结果的去重校验和交叉验证匹配完成之后不能直接生成面板变量必须先做几个方向的正确性校验。第一是申请人名称和工商名称的“一对多”检查同一企业名称如果对应了多个信用代码需要核实是否存在重名企业这在跨省场景并不少见或子公司与母公司的权益人混同。我的处理规则是能明确识别到分公司或子公司的不纳入母公司名下合并统计如果同一实际控制人下多家主体都从事研发则按专利权利人主体名称记录归属不按集团层级做跨主体合并。第二是抓一批已知创新产出多的大企业做抽样人工核查例如选20家企业逐一手动查看它们在某几个年度的专利申请量是否和公开年报、知识产权披露信息吻合。这种做法的本质是给自动匹配流程上一道安全阀。4.3 从长表到面板1985-2024年的年度拼接清洗完成的专利-企业long format数据最终要转成企业-年度短面板。具体操作上就是将每个企业的每件专利按申请年份和授权年份分别计数同时分组统计数字技术专利、发明专利、实用新型等不同技术类型的细分计数空白年份则补零。这一步看起来机械实际有两个关键细节第一样本企业的出生年份必须事后统一校正比如一家企业2002年成立那么它1985-2001年的专利计数应该为空或记为0而不是因为补零逻辑让它在成立前有专利记录这个错误在真实研究里真的出现过第二如果数据库要支撑多期研究不要只生成一套平衡面板因为从1985年到2024年跨越太久绝大多数早期成立的科技型企业在2024年可能已经不再符合“初创”定义平衡面板会把样本大幅削减导致严重的幸存者偏差。除了数据结构本身维护一份长跨度面板还需要记录数据版本和口径变更日志每一次因为专利数据库更新带来的新增记录都要能回溯到具体来源批次否则不同版本之间直接对不上研究结果就完全不可复现。5. 这套数据能做哪些研究从描述性统计到政策效应识别数据库建出来毕竟要服务于具体研究问题很多朋友会问我这类企业专利面板数据到底适合跑什么样的话题。我根据自己的实际使用经验把它能支撑的方向大致分成三个层次。5.1 第一层创新产出全景的描述性事实这算是数据最直接的用处。通过绘制不同年份三类企业数字技术专利申请量、授权量的变化趋势可以非常直观地回答几个基础但重要的问题数字技术专利申请量在哪个时间段出现明显跃升三类企业的申请结构发明专利占比、数字技术专利占比是否呈现收敛或发散的演变态势瞪羚和独角兽在专利产出上是否从数量驱动转向质量驱动这些描述性统计虽然方法门槛不高却是后续很多研究的立论基础。我拿这套数据几个主要年份做过简单趋势统计结果非常有意思在2014年之前科技型初创企业数字技术专利占比一直低位徘徊2015年之后出现陡峭式抬升而那几年恰好是移动互联网和数据要素市场快速扩张的时期。这种时间上的高度耦合本身就是值得写成图表去讲清楚的故事。5.2 第二层企业成长机制与创新策略研究面板数据最大的优势是可以做动态分析。比如用企业固定效应模型考察数字技术专利存量对企业后续年份营收增速、获融资次数、企业估值的影响也可以把专利申请和授权之间的滞后结构看成企业“从研发投入到创新产出”的转换效率去对比不同类型企业转换效率的差异。另一个我尝试过且结果不错的角度是把企业获得瞪羚认定或独角兽认定当作一个准自然实验用多期DID双重差分来估计“获得高成长标签”对企业后续数字技术专利申请行为的因果效应。这时候面板时间维度上的“认定前-认定后”、横截面上的“认定企业-未认定企业”提供双重差异识别逻辑非常干净。不过要注意的是瞪羚认定并不是随机的企业在认定前往往已经经历了高增长申请专利也可能同步高位运行因此平行趋势假定需要仔细检验。5.3 第三层数字经济政策与发展环境的评估由于关键数字技术专利直接锚定了数字经济主赛道这套数据也很适合用于评估区域性数字经济政策或者数字基础设施建设的微观创新效应。比如可以考察某个城市或某个高新区数字产业政策密集出台之后辖区内瞪羚、独角兽和科技型初创企业的数字技术专利是否有显著提升。更精细的设计可以把政策强度和企业初始数字技术专利水平做交互项看政策是否更多激励了原本就有数字技术积累的企业马太效应还是同样带动了原本零产出的企业普惠效应。这种研究对政策制定者有实际参考价值。做这类分析时数据显示的数据颗粒度需要下探到企业注册所在区县所以构建数据时最好补全行政区划代码字段至少保持到地级市精度。6. 长面板数据使用中的几个高频坑和实操建议数据已经建好并且跑过多轮研究之后有些问题会反复出现下面这几条算是我亲测最值得强调的部分新手建议直接记下来。6.1 专利申请授权时间差会让最近几年的“授权量”系统性偏低如果你想用这套数据做2022-2024年的分析你会发现最近两三年授权量明显偏低尤其是发明专利。这不是企业不创新了而是审查周期导致的。发明专利申请到授权平均需要两到四年很多2023年申请的专利到2024年底还根本不可能有授权结果。解决思路有三种一是把分析窗口截断在申请年份往前推三到四年的区间二是只在专利申请量口径下分析最近年份三是给授权量乘上一个基于历史平均授权滞后期推算的调整系数。我个人强烈建议前两种第三种调整系数在学术评审里说服力不足容易引起争议。6.2 样本选择偏误能查到数据的企业本身就是活下来的企业这是一个很难完全消除但必须时刻提醒自己的问题。1985年成立的一批科技型初创企业中很多早就在市场上消失了它们的专利记录和成长数据要么缺失、要么彻底无法获得你最终能把名单匹配全的企业本质上是一批幸存者。这在研究长周期的企业增长问题时会造成典型的“幸存者偏差”。处理办法包括在正文里明确讨论存活企业样本可能带来的影响方向、用多种样本口径做稳健性检验以及尽量把企业出生年份加进来做更广义的匹配样本不要只盯现存企业或上榜企业。6.3 维护成本不容忽视数据库版本管理必须提前规划横跨40年的面板数据永远不会是静态的。一方面专利数据库本身在持续更新隔几个月重新导出数据申请量和授权量数字就可能变化另一方面企业名单来源每年也在更新瞪羚和独角兽名单每年都会增补新面孔这意味着一套好用的数据必须做成可以持续迭代的版本化工程。我的习惯是每个季度导出一个数据快照按版本号归档数据库变更说明做成单独的变更日志文档。没有这套管理习惯的话三个月后你甚至可能无法解释自己数据里某个数字为什么会和之前的版本差几百件专利。6.4 检索时分类号体系的新旧版本切换另一个容易被忽略的细节是IPC分类号每五年左右会修订一次某些数字技术相关的技术在早期没有对应分类号只能被分在旧类目下。比如H04L等分类体系在不同版本年份就有类目调整。处理方式是在检索时把早期年份的专利和近期年份的专利分开用各自的IPC版本策略或者干脆统一采用最新版本分类号回标历史数据。根据我的经验后者在大规模数据下更可靠但需要调用专利数据库精确到分类号版本号的字段这个字段多数人在导出时根本不会注意很容易漏掉。