企业接入知识产权数据资源,怎样把目录、数据集和 FTO 预警分开审?
国家知识产权局、国家数据局关于加强知识产权数据资源开发利用的意见,提出数据资源目录、分类分级、AI 应用和企业创新全流程利用。江苏鑫律联律师事务所建议企业按来源、加工、模型、交付和安全五个接口审查。
企业接入专利、商标、许可、转让、裁判或产业分析数据时,不能只让技术团队确认“接口能不能跑”。国家知识产权局、国家数据局 2026 年 8 月 26 日发布的意见提出,要加强知识产权数据资源全生命周期管理、分类分级和公共数据资源目录,推进人工智能应用和高质量数据集建设,并把数据利用嵌入研发、成果转化、维权保护、自由实施分析和专利预警。
这项政策方向适合转化为企业的接入审查表,但不构成对全部数据的无条件抓取、训练或再分发授权。建议至少分五个接口处理。
一、目录接口:先确认数据身份和来源规则
采购或接入前,企业应记录数据提供方、官方目录或页面、接口地址、账号身份、许可或服务条款、可取得字段、更新机制和留存期限。不同业务系统中的公开信息、下载文件、检索结果和第三方整理数据,不能仅凭“都与知识产权有关”共用一个来源结论。
对于公共数据或开放查询服务,还要进一步确认允许的访问频率、批量下载、机器访问、缓存、建库、客户交付和商业化方式。政策提出建立目录和分类分级体系,不等于企业可以跳过具体平台规则和数据提供方约定。
二、加工接口:原始数据和企业数据集要分开
企业对数据做清洗、去重、关联、标注、结构化或特征提取后,形成的数据集可能有新的管理和运营价值,但加工行为不自动解决原始数据的复制、再利用、个人信息、商业秘密或数据库权益问题。
数据集立项时,应同时保留原始来源表、字段变化、处理规则、加工人员或供应商、版本哈希、删除和更新机制。客户数据、内部研发资料、代理或合作方材料混入公共知识产权数据集时,还要标记其独立的合同和保密边界。
三、模型接口:检索、RAG、训练和报告用途分开
如果数据进入搜索系统、RAG 知识库、行业模型训练、自动标注或客户报告,合同和内部审批应分别写明用途、字段、访问人员、供应商、境外处理、再训练和服务终止后的删除或返还。
同一数据可以支持人工查询,不代表可以永久留在模型记忆或用于其他客户项目;客户委托检索形成的资料,也不代表企业可以沉淀为通用训练集。对外提供 API 或报告时,还要明确数据更新日期和输出可能遗漏的范围。
四、FTO 与预警接口:线索、判断和结论分三层
意见明确鼓励利用知识产权数据开展技术生命周期分析、申请前评估、专利自由实施分析和预警分析。企业可以用 AI 提高检索和比对效率,但不能把模型摘要直接当作侵权、授权或“没有风险”的法律结论。
交付 FTO 或专利预警报告前,应由专业人员核对权利要求、法律状态、同族和地域范围、申请或公开时间、目标产品技术特征、检索式、数据版本以及纳入或排除理由。报告中应注明检索截止日、覆盖数据源、人工复核范围和仍待验证的专利或事实。
五、安全和交付接口:把供应商和客户边界写进合同
合同至少要处理:数据来源和授权责任、更新频率、字段和接口变化通知、个人信息和商业秘密保护、模型或供应商转委托、日志、客户交付、再分发、错误更正、侵权投诉、暂停使用、返还删除和证据保留。
企业内部还要设置数据访问分级、下载和外传控制、模型调用日志、异常告警和人工复核责任。涉及跨境模型或境外云服务时,不能只看服务器是否能连通,还要单独审查数据出境、供应商处理和客户合同边界。
最小可用材料包
| 环节 | 至少保留 | 复核问题 |
|---|---|---|
| 取得 | 目录、页面或接口、账号、规则和时间 | 是否允许当前访问、复制和商业用途 |
| 加工 | 字段、清洗标注、版本、供应商和删除记录 | 是否混入个人信息、秘密或客户资料 |
| AI 使用 | 模型、提示或检索配置、权限、日志和版本 | 是否超出约定用途或进入再训练 |
| 业务输出 | FTO/预警范围、截止日、人工复核和限定语 | 是否把线索写成确定法律结论 |
| 退出 | 停止采集、客户返还、删除、更新和留证 | 是否真正处理了缓存、备份和模型副本 |
政策鼓励知识产权数据资源发挥作用,企业更需要把“能用”与“怎么用、用到哪里、谁来验证”分开。只要来源规则、用途、版本和输出审核不能闭合,最稳妥的交付表达就应限于已核实范围和待核对线索。
本文仅提供一般法律信息,不替代对具体数据资源、平台规则、AI 系统、专利 FTO、客户合同或数据安全安排的专项核验。