数据不能上公网,AI难以落地
越来越多的政企单位和企业开始尝试使用大模型。使用公开资料进行演示时,模型通常能够快速生成内容、回答问题;但进入真实业务场景后,首先遇到的往往不是模型能力问题,而是内部数据不能上传公网。
企业制度文件、合同资料、客户信息、项目文档、业务数据库和系统运维记录等数据,通常受到内部管理、业务安全和合规要求限制。如果不能明确数据的传输路径、存储位置、使用范围和保留方式,就不能直接提交给公网AI平台处理。
因此,很多AI项目能够完成通用功能演示,却无法接入真实业务数据,最终长期停留在试用阶段。
一、哪些企业数据通常不能直接上传公网
企业内部数据种类较多,不同数据对应的安全级别和使用要求也不相同。以下资料通常需要在明确授权和受控环境中使用:
• 企业内部制度、会议纪要、工作方案和管理文件;
• 客户资料、合同信息、项目文档和商务记录;
• 业务数据库中的订单、工单、设备和运营数据;
• 员工、客户或合作方相关的个人信息;
• 产品设计、技术方案、研发资料和知识产权内容;
• 系统日志、运维手册、网络信息和内部配置说明;
• 尚未公开的经营数据、统计结果和决策材料;
• 受行业监管、保密制度或客户合同约束的数据。
数据安全风险也不只是“上传了一个完整文件”。用户输入的问题、从文档中截取的内容、模型调用日志和生成结果,都可能包含企业内部信息。
如果企业不能确认数据是否会被保存、由谁访问、保存多长时间以及是否会被用于其他用途,就很难将真实业务数据直接接入公网模型。
公网大模型适合处理公开信息和通用任务,但对于受控的企业私有数据,需要采用不同的部署和数据处理方案。
二、数据不能出网,会给AI项目带来哪些困难
当真实数据不能上传公网时,企业AI项目容易出现以下情况:
• 只能使用公开资料或模拟数据进行演示,无法验证真实业务效果;
• 为了调用公网模型而进行大量人工脱敏,处理成本较高,并可能破坏原有业务语义;
• 内网系统无法直接访问外部接口,模型调用和业务系统难以对接;
• 文件虽然已经整理出来,但不能交给外部平台进行解析、生成和评估;
• 公网模型能够回答通用问题,却不了解企业内部制度、术语和业务流程;
• 知识库无法接入真实数据,只能展示少量经过筛选的资料;
• 生成结果缺少原文证据和来源记录,业务人员不敢直接使用;
• 数据更新后,需要反复进行导出、脱敏和人工处理,难以持续维护;
• 项目缺少真实数据下的质量指标和验收依据,难以正式交付。
如果安全边界问题没有解决,模型能力再强,也很难进入企业核心业务场景。
三、数据不能上公网,并不等于不能使用AI
对于不能离开客户网络和管理范围的数据,可以采用本地化部署方式,在客户内网、本地服务器或受控私有云环境中完成数据处理和模型应用。
一条本地化的企业AI处理链路可以包括:
企业文档与业务数据库 → 本地数据接入 → 内容提取与清洗 → 内容切分与来源标记 → 企业语料库 → 高质量数据集 → 本地知识库或模型微调
在这条链路中,原始文件、数据库记录、内容片段、问答样本、向量索引和质量报告均可保留在客户控制的环境中。
本地化方案通常可以实现:
• 在客户授权范围内读取和处理内部资料;
• 使用本地工具完成文档解析、数据清洗和内容切分;
• 使用本地大模型生成或辅助整理问答数据;
• 在内网中建设企业专属语料库和知识库;
• 本地保存问题、答案、原文证据和数据来源;
• 在不依赖公网服务的情况下完成质量检查和报告生成;
• 根据客户现有制度管理账号、权限、日志、备份和数据使用范围;
• 通过离线安装包、模型文件或镜像完成受控环境部署。
如果客户明确授权部分脱敏数据使用公网模型,也可以根据项目要求采用受控的混合方案;对于明确要求数据不出域的场景,则应优先采用完整的本地处理链路。
四、本地部署模型,并不等于AI已经能够落地
有些企业已经在内网部署了大模型,认为只要模型能够运行,内部数据就可以直接使用。实际上,本地模型只解决了模型运行位置的问题,并不会自动解决企业数据质量问题。
如果把未经治理的资料直接导入本地知识库,仍然可能出现:
• 文档格式复杂,正文提取不完整;
• 多个版本同时存在,模型无法判断哪一份有效;
• 内容切分不合理,完整的业务规则被拆散;
• 数据大量重复,检索结果被相似内容占据;
• 数据库字段使用内部编码,模型无法理解其业务含义;
• 回答虽然完整,却与企业真实制度不一致;
• 结果没有原文证据,无法返回原始资料核验;
• 缺少质量检查,无法判断哪些数据可以正式使用。
因此,企业AI本地化不仅需要模型和服务器,还需要完成数据范围梳理、数据治理、语料库建设、高质量数据集生产和效果评估。
特别是本地模型的能力、算力条件和运行效率可能与公网模型存在差异,更需要通过高质量数据、合理的知识检索和明确的业务任务设计提高实际效果。
五、飞燕AI如何解决
飞燕AI面向不能直接上传公网的企业私有数据,可根据客户现有网络和技术环境,在授权范围内建设本地数据处理与AI应用链路。
在安全边界确认阶段,先明确需要处理的数据来源、业务范围、部署环境和交付方式,确认哪些数据可以使用、哪些数据需要排除,以及处理成果保存在哪里。
在本地部署阶段,将数据处理程序、必要的模型能力和知识库组件部署在客户内网或受控环境中,使原始数据和处理成果保留在客户管理范围内。
在数据治理阶段,对客户授权的Word、TXT、PDF、表格数据和业务数据库进行接入、清洗、切分、去重和标准化处理,同时保留数据来源和处理记录。
在语料库建设阶段,将篇幅较长、格式不同的原始资料整理为适合知识检索和数据集生成的内容片段,并建立内容片段与原始文档或数据库记录之间的关联。
在数据集建设阶段,可使用本地模型围绕企业真实资料生成问答样本,并形成:
问题 → 答案 → 原文证据 → 数据来源
之间的关联关系。系统进一步检查样本结构、答案内容、证据一致性和重复情况,减少无效或错误数据进入后续应用。
在质量评估阶段,对数据来源、生成结果、证据一致性、重复情况和数据范围等信息进行汇总,并在本地生成数据集质量报告。客户可以通过质量指标、风险提示和代表性样本判断当前成果是否具备交付条件。
在应用阶段,可使用完成治理的企业语料库建设本地知识库,实现内部资料检索、智能问答和来源核验;在具备相应条件时,也可以使用高质量数据集开展LoRA微调和效果评估。
六、可交付成果
根据项目范围,飞燕AI可提供以下成果:
• 企业数据来源、授权范围和主要质量问题的梳理结果;
• 完成清洗、切分、去重和标准化处理的企业语料库;
• 内容片段与原始文档或数据库记录之间的来源关联;
• 包含问题、答案、原文证据和来源信息的高质量数据集;
• 包含质量指标、风险提示、代表性样本和交付状态的数据集质量报告;
• 支持资料检索、智能问答和来源核验的本地知识库;
• 本地部署、数据处理和成果使用所需的相关技术说明;
• 根据需要提供LoRA微调、效果评估和部署支持。
七、先在内网中验证一个真实业务场景
对于数据不能上公网的企业,不必一开始就建设覆盖全部部门的大型AI平台。更稳妥的方式,是先选择一个数据范围明确、业务需求真实的场景,在客户内网中完成小范围验证。
例如,可以选择一批制度文件、项目资料、运维手册或业务数据库记录,重点检查:
• 原始数据是否始终保留在客户控制环境内;
• 不同格式的资料能否被正确提取和处理;
• 内容切分和来源记录是否准确;
• 本地知识库能否检索到正确内容;
• 模型回答是否符合企业业务口径;
• 回答能否提供原文证据和数据来源;
• 数据质量能否通过指标、样本和报告进行评估;
• 现有服务器和模型能否满足实际使用要求。
确认处理链路、安全边界和应用效果达到要求后,再逐步扩展到更多数据来源、业务部门和应用场景。
飞燕AI希望解决的核心问题是:让企业在不突破数据安全边界的前提下,将内部文档和业务数据逐步转化为可检索、可追溯、可评估的AI数据资产,让数据留在客户控制范围内,也能真正支撑企业AI应用落地。