国家”十四五”数字档案馆建设规模最大的央企试点
某特大型央企企业集团数字档案馆(室)建设试点项目,是国家档案局确定的重点试点工程
🏢客户背景
某特大型能源化工央企,业务涵盖油气勘探开发、炼油化工、产品销售等全产业链,综合实力位居世界500强前列。集团总部设于北京,旗下拥有多家大型骨干企业。
🎯项目定位
本项目是国家档案局确定的企业集团数字档案馆(室)建设试点项目,属于”十四五”全国档案事业发展规划的重点任务。在国家档案局推进企业档案工作数字化转型的大背景下,客户依托大数据、人工智能、区块链等新一代信息技术,打造全国集中式数字档案馆系统。
| 序号 | 建设内容 | 说明 |
|---|---|---|
| 1 | 数字档案馆系统建设 | 建设集团统一数字档案馆,覆盖档案协同、收集、管理、保存、利用、基础管理、集成管理7大模块 |
| 2 | 统一归档集成管理 | 14+业务系统归档接口标准化,打造归档集成标准化体系 |
| 3 | 新平台实施及数据迁移 | 替代156套企业级旧系统,历史数据统一迁移至新平台集中管控 |
| 4 | 档案业务组件/数据建设 | 沉淀文档质检、文档转换、组合阅读等业务组件,按”三库分离”优化数据存储 |
✅验收情况
2025年10月9日,国家档案局组织专家组对该央企企业集团数字档案馆(室)建设试点进行验收。验收组听取试点工作报告、观看系统演示、审阅相关文档并进行了质询交流,认为客户实现了公文、合同、物资招投标、工程招投标等业务系统的电子文件归档和电子档案管理,集团总部及2,779家所属试点单位完成数字档案馆(室)建设任务,同意通过验收。
验收专家组一致认为,该项目着眼转型升级,在国产化云平台上,创新应用人工智能、区块链等技术打造企业集团数字档案馆,为档案事业高质量发展提供有力支撑。
60万注册用户,覆盖全集团所有档案管理角色
系统面向集团全体成员提供档案管理服务,覆盖从集团总部到基层单位的所有层级
👥用户类型
百亿级数据、PB级存储,央企档案领域数据规模最大
系统规划支撑30年生命周期,面临百亿级结构化数据和PB级非结构化存储的极致挑战
📊存量数据(2018年基准)
| 数据类型 | 数量 |
|---|---|
| 结构化数据总量 | 8,110万条 |
| 文件数 | 4,180万 |
| 案卷数 | 760万 |
| 电子原文数 | 3,170万 |
| 历史非结构化原文存储 | 约 208 TB |
📈增量数据
| 维度 | 数据 |
|---|---|
| 日均归档量(平均) | 200万条/日 |
| 日均归档量(峰值) | 500万条/日 |
| 非结构化存储年增量 | 约 200 TB/年 |
🔮30年增长预测
| 时间节点 | 数据总量 | 文件数 | 原文数 | 结构化存储 |
|---|---|---|---|---|
| 2023年(当前) | 64亿 | 34亿 | 24亿 | 约 178.8 TB |
| 2年后(2025) | 90亿 | 46亿 | 35亿 | 约 253 TB |
| 10年后(2033) | 196亿 | 101亿 | 77亿 | 约 547.6 TB |
| 30年后(2053) | 457亿 | 236亿 | 178亿 | 约 1.28 PB |
💾存储架构支撑
央企档案信息化领域前所未有的复杂工程
超大规模、全栈国产化、多层级覆盖等多重挑战
⚙️架构复杂度 — 16个微服务集群
| 序号 | 微服务 | 功能域 |
|---|---|---|
| 1 | 档案管理服务 | 核心档案管理 |
| 2 | 档案利用服务 | 检索、借阅、利用 |
| 3 | 档案编研服务 | 档案编研、知识挖掘 |
| 4 | 档案移交服务 | 档案移交接收 |
| 5 | 库房管理服务 | 实体档案库房管理 |
| 6 | 归档服务 | 电子文件归档处理 |
| 7–16 | 文件/索引/报表/流程/鉴定/人脸识别/图像识别/四性检测/流程化/基础服务 | 完整业务覆盖 |
🖥️硬件规模
| 硬件类型 | 数量 | 配置 |
|---|---|---|
| 达梦数据库集群物理机 | 3台 | 384核心 / 1,536GB内存 / 253TB SSD |
| ElasticSearch物理机 | 49台 | 1,248核心 / 2,496GB内存 / 39TB SSD |
| 应用服务器 | 48台 | 768核心 / 1,536GB内存 |
| 负载均衡 | 3台 | — |
生产服务器总计103台,CPU超2,300核心,内存超5,500GB
🇨🇳全栈信创国产化
| 层级 | 选型 | 说明 |
|---|---|---|
| CPU | 飞腾S2500(ARM架构) | 国产处理器 |
| 操作系统 | 麒麟V10 | 国产操作系统 |
| 数据库 | 达梦DM8 | 一主二从读写分离,按全宗拆库 |
| 办公套件 | WPS | 国产办公软件 |
| 对象存储 | 华为OBS | 信创路线对象存储 |
| 开放框架 | Jfinal | 基于Java的轻量级开发框架 |
⚠️六大实施难点
| 难点 | 详情 |
|---|---|
| 周期短、内容多 | 2023年6月启动设计,2023年12月主体上线,仅6个月完成16个应用、7大模块、14+业务系统集成 |
| 数据量巨大 | 日均500万条归档峰值,208TB历史数据迁移,30年内将达百亿级记录、PB级存储 |
| 多层级覆盖广 | 2,779家单位遍布全国,多级全宗架构,各单位业务需求个性化极强 |
| 产品改造范围大 | 视图管理、整编视图、库藏视图、检索视图等全面定制 |
| 功能业务性要求高 | 四性检测、OFD版式文件、区块链存证等均为深度定制功能 |
| 灵活性要求强 | 著录项关联关系分级管理,支持不同全宗/单位按需自由配置元数据模型 |
8大特色亮点,全面领先同类央企数字档案项目
在信创国产化、区块链存证、AI智能化、超大规模处理、灾备体系等方面形成突出优势
主体建设仅18个月,创造央企超大规模档案系统建设的”项目速度”
2023年6月启动,2025年10月通过国家档案局验收
👥团队组织
项目实行项目经理负责制,建立PMO管理组、架构管控组、项目咨询组、业务专家组、技术专家组等多层级管理体系。研发团队分为9个专业小组,总计36人以上,另有驻场团队5人在北京客户现场与客户面对面协作。
项目核心指标一览
| 维度 | 关键指标 |
|---|---|
| 客户 | 某特大型能源化工央企(世界500强前列) |
| 项目定位 | 国家档案局企业集团数字档案馆(室)建设试点 |
| 覆盖单位 | 集团总部 + 2,779家所属单位 |
| 注册用户 / 日均活跃 | 60万人 / 6,000人 |
| 并发支持 | ≥1,000 |
| 存量结构化数据 | 8,110万条 |
| 日均归档峰值 | 500万条 |
| 30年数据预估 | 457亿条 / 约1.28PB |
| 生产服务器 | 103台(3+49+48+3) |
| 技术栈 | 飞腾S2500 + 麒麟V10 + 达梦DM8 + 东方通TongWeb(全栈国产化) |
| 微服务数 / 功能模块 | 16个 / 7大模块 |
| 集成业务系统 | 14+个 |
| 国家验收通过 | 2025年10月9日 |
央企档案数字化转型的可复制成功范式
四个”最”定义央企档案数字化标杆
建设规模最大 · 技术栈最全 · 数据处理量最大 · 覆盖范围最广