行业场景
AI+民国书报刊
智慧整理编研一体机
针对民国时期书籍、报纸、期刊,实现复杂版面自动分析、文章切割、竖排与繁简混排识别、时间人物地点自动抽取。
93.8%
综合识别率
8万+
已处理民国图书
200+
报纸种类
核心功能
覆盖文献整理全流程,从识别到编研一站完成
复杂版面自动分析
自动识别报纸、期刊中的文章区块、广告、插图、标题等元素,精准还原原始版面结构。
文章级自动切割
将报纸版面自动切割为独立文章,支持跨栏、跨版文章的自动合并与关联。
竖排繁简混排识别
支持民国时期常见的竖排、繁简混排、中英文混排等多种排版形式的自动识别。
技术亮点
多项自主研发的核心技术,确保行业领先的处理效果
1
复杂版面分析引擎
基于深度学习版面分析模型,支持报纸、期刊、书籍等多种民国出版物的版面结构识别。
2
竖排文字识别优化
针对民国竖排印刷的字体特征专项训练,对铅印、石印等多种印刷方式均有优化。
3
繁简混排处理
自动识别文本中的繁简混排区域,支持繁体中文、简体中文、英文、数字的混合识别。
4
文章关联与合并
自动识别跨栏、跨版的连续文章,支持基于标题、作者、时间等特征的文章自动关联。
5
实体自动抽取
自动抽取文章中的人名、地名、机构名、时间等实体,支持民国时期特有实体(如旧地名、旧机构名)。
6
全私有化部署
支持全离线运行,数据安全可控。提供API接口与图书馆馆藏系统无缝对接。
典型案例
北京大学某院系图书馆
馆藏民国文献全文数字化
为北京大学某院系图书馆提供民国报纸智慧整理,处理馆藏民国图书8万余种、民国报纸200余种。实现复杂版面自动分析、竖排繁简混排识别、文章级切割与实体抽取,构建了民国文献全文检索与知识发现平台。
📊 民国图书8万+ | 报纸200+种 | 综合识别率99.3%
服务流程
常见问题
民国报纸的版面分析准确率如何?+
基于深度学习版面分析模型,对民国报纸的文章区块、广告、插图、标题等元素识别准确率可达95%以上。支持跨栏、跨版文章的自动合并。
支持哪些类型的民国出版物?+
支持民国时期的书籍(铅印、石印)、报纸、期刊等多种出版形式。对竖排、繁简混排、中英文混排均有优化。
综合识别率能达到多少?+
民国书报刊的综合识别率达到93.8%。铅印清晰的书籍可达96%以上,报纸因纸张和印刷质量不同,识别率在90%-95%之间。
是否支持实体自动抽取?+
支持。可自动抽取文章中的人名、地名、机构名、时间等实体,特别针对民国时期特有的旧地名、旧机构名进行了优化。
能否处理跨版文章?+
支持。系统可自动识别跨栏、跨版的连续文章,基于标题、作者、时间等特征进行文章自动关联与合并。
了解AI+民国书报刊
如何助力您的工作
提交您的需求,我们将在24小时内与您联系,提供专属方案与报价。
获取方案与报价
我们将在24小时内与您联系