☰
2008-2026.8生成式人工智能专利明细数据库
2026/9/29 22:20:48 网站建设 项目流程

一、数据概况

以大语言模型、扩散模型和多模态模型为代表的生成式人工智能正快速发展,应用场景从文本生成、图像生成延伸到代码、音频与视频生成,已成为人工智能技术创新的重要方向。要刻画这一领域的创新产出,专利数据提供了一个直接的技术研发视角——创新主体的技术活动会沉淀在专利的申请与授权记录中。

本数据库以中国专利文献信息为基础,借助生成式人工智能技术关键词、IPC分类号以及专利文本语义识别三类手段,对生成式人工智能相关专利进行识别与整理。数据集包含国际专利分类号、申请人与地址、申请人类型、申请日、公开公告日、授权公告日、发明人、摘要文本、主权项内容等核心字段,可为企业层面与区域层面的人工智能创新研究提供数据支撑。

二、专利识别与整理流程

专利筛选以专利名称、摘要和第一项权利要求为主要读取对象,分为两条并行路径,命中任一路径即可进入后续校验:

路径一:出现专有名称(不看分类号)

只要文本中出现下列任一专有名称即命中:生成式人工智能、生成式AI、AIGC、生成对抗网络、对抗生成网络、生成式对抗网络、生成对抗式网络、变分自编码器、变分自动编码器、扩散概率模型、去噪扩散、神经辐射场、自回归生成、生成式预训练、大语言模型、大型语言模型、ChatGPT、GPT-3 / GPT3、GPT-4 / GPT4,以及英文表述 generative adversarial network、variational autoencoder、denoising diffusion、generative pre-trained / pretrained、large language model。

路径二:出现泛称或缩写,且同时命中分类号

泛称或缩写包括 GAN、VAE、LLM、GenAI、NeRF、扩散模型、自回归模型、自回归解码、生成式潜在优化,以及「图像 / 文本 / 视频 / 语音 / 分子 / 代码……生成模型(网络)」这一句式。其中泛称「大模型」须与语言、文本、对话、提示词、预训练、多模态等同字段共现。

分类号须属于以下共63个类别:神经网络 G06N3 全组40个;语音合成 G10L13 共10个;机器学习 G06N20 共3个;自然语言处理 G06F40/20、/284、/40;训练样本生成 G06F18/214;其余为 G06Q10/04、G06V10/70、G16H30/40、H04L51/02。

同形词检查与整类排除(命中则不入库)

• 物理扩散类:扩散系数、扩散方程、扩散时间、扩散速率、扩散距离、扩散范围、扩散规律、扩散浓度、扩散半径、扩散速度、扩散趋势、气体扩散、烟气扩散、烟雾扩散、粉尘扩散、污染物扩散、污染扩散、泄漏扩散、热扩散、温度扩散、水量扩散、溶质扩散、离子扩散、菲克、高斯烟羽、大气扩散、羽流;

• 时序自回归类:ARIMA、ARMA、GARCH、ARCH模型、自回归滑动平均、自回归移动平均、整合移动平均、差分自回归、向量自回归、VAR模型、时间序列预测、软测量;

• AIGC 周边:全文出现 AIGC 却未出现生成、合成、创作、生产、绘制、绘图、作图、画图、生图、作画等表述;

• 整类排除:外观设计,以及标题中含增材制造、3D打印、3D打印机的文献。

入库与标签

通过校验的文献正式入库,并同时打上两个标签。一是生成模型族:生成对抗网络、变分自编码器、扩散模型、大语言模型、自回归模型、未指明模型;二是生成模态:文本、图像视频、语音音乐、3D模型、软件代码、分子基因蛋白、其他。两个标签均为多值,一条文献可同时携带多个;采用豁免优先原则,只要存在一个生成式标记,即不因其他命中的排除词而否决。

三、数据介绍

四、数据指标

数据集共包含24个字段,覆盖模型类型、模态、专利标识、申请人与地址、时间节点以及文本内容等维度,具体如下:

五、数据概览

历年专利申请情况

下图统计了2008年至2026年8月生成式人工智能相关专利的历年申请量。可以看到,2016年之前相关申请寥寥无几,此后逐年攀升,2021年起进入快速增长通道,2024年、2025年申请量分别约为3.0万条和4.4万条,规模迅速放大。

注:该统计按明细数据条数计、未按专利去重;数据库在2008年之前无申请记录;2026年数据截至8月,且2025—2026年的申请量受发明专利18个月公开期影响,存在偏低。

图1 生成式人工智能历年专利申请情况(2008—2026.8)

图1 生成式人工智能历年专利申请情况(2008—2026.8)

专利明细样本

数据以明细表形式组织,每行对应一条专利记录,字段涵盖模型类型、生成模态、专利名称、专利类型、申请人及其类型、地址与所属地区、申请号与日期、公开公告与授权公告信息、IPC分类号等。下表为样本部分字段的横向视图,完整24个字段的清单见上一节。

注:样本仅为部分字段的横向视图,专利名称、申请人、申请人地址等字段受列宽限制未完整显示;发明人、摘要文本、主权项内容等字段未包含在视图范围内。

图2 生成式人工智能专利明细样本(部分字段横向视图)

图2 生成式人工智能专利明细样本(部分字段横向视图)

六、应用方向

专利明细数据可从企业、区域和技术三个层面支撑人工智能创新研究:

•企业创新画像:以申请人(含申请人类型、所属地区)为单位,统计生成式人工智能专利的申请与授权数量,刻画企业、高校及科研机构的技术布局;

•区域创新比较:按申请人地区、城市、区县汇总,比较不同区域在生成式人工智能领域的创新产出与集聚程度;

•技术主题分析:基于生成式AI模型类型与生成模态两个标签,分析大语言模型、扩散模型、生成对抗网络等方向的技术演进与结构变化;

•文本挖掘:利用摘要文本与主权项内容开展主题建模、关键词演化等技术文本分析;

•跨库匹配:以申请人名称、申请人地区为键,与工商注册、上市企业、区域经济等外部数据融合使用。


数据来源:国家知识产权局(中国专利文献信息)。

顶部专栏分享更多内容

经管社科数据整理与分析_Paper数据分析的博客-CSDN博客

来源:Paper数据分析

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询