arXiv:2605.30235cs.CV2026-05中稿 · presentation at IC…

构建手写文献识别与作者溯源新基准,涵盖近50万行多语言历史文本。

BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval

论文配图:BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval
图 1 · 摘自论文原文
  • 基于布林格书信集构建大规模手写文本数据集,含796位作者、49.9万行文字。
  • 最佳模型TrOCR在文本识别上达到9.1%的词错误率,作者检索平均精度为78.3%。
  • 提出时间感知评估指标,适合研究历史文本风格演化与跨时代作者识别者。

我们提出BullingerDB,一个基于海因里希·布林格(1504–1575)通信记录的历史文献分析大规模基准数据集。该语料库包含20,898页、499,222个文本行,由796位作者在六十年间书写,涵盖风格差异、多语言内容(主要为拉丁语和早期新高地德语)以及作者身份与时间等元信息。我们在文本识别与作者检索任务上评估该数据集。最佳模型TrOCR取得9.1%的词错误率(CER)。针对作者检索,引入时间感知nDCG指标评估时序相关性;尽管可实现时序一致检索,但因长期风格变化,平均精度(mAP)仅为78.3%。BullingerDB旨在建立多语言历史文本识别与时间敏感作者分析的新基准。

原文摘要 · Abstract (English)

We present BullingerDB, a large-scale benchmark dataset for historical document analysis based on the correspondence of Heinrich Bullinger (1504-1575). The corpus comprises 20,898 pages and 499,222 text lines written by 796 writers over six decades, featuring stylistic variation, multilingual content (mostly Latin and Early New High German) as well as meta-information such as writer identity and time. We evaluate BullingerDB on text recognition and writer retrieval. TrOCR, the best performing model, achieves a CER of 9.1%. For writer retrieval, we introduce a temporal nDCG metric to assess time-aware retrieval. While temporally coherent retrieval is achievable, mAP (78.3%) scores indicate challenges due to long-term stylistic variation. With BullingerDB, we aim to establish a new benchmark for multilingual historical text recognition and temporally-aware writer analysis.

手写识别历史文献作者溯源多语言

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。