白翔 Xiang Bai

场景文字检测与识别(Scene Text)领域代表学者,CRNN 共同作者,OCR 一条线上的中坚力量。

研究方向及演变

形状表示与 2D/3D 形状匹配检索 → 场景文字检测与识别 → 目标检测/图像分类 → 近年扩展到文档 AI 与多模态大模型(MonkeyOCR 系)。研究长期围绕「让机器读懂图像中的文字」。

单位沿革(时间线)

  • 华中科技大学(HUST)通信与信息工程 博士。
  • 现为 华中科技大学 人工智能与自动化学院 教授,领导 Vision and Learning Representation Group(VLR Lab)。发表论文 250+ 篇。其团队的场景文字技术被华为、阿里、美团等产品采用。

代表作(本 Wiki 双链)

  • crnn(2015)— 端到端可训练的图像序列识别网络(CNN+RNN+CTC),文字识别经典架构,影响后续几乎所有 OCR 识别器。
  • monkeyocr-v2(MonkeyOCRv2)— 文档 AI 视觉-文本基础模型(HUST / 金山),把场景文字积累延伸到现代 VLM 文档解析。

活跃时间与影响

2010 年代至今持续活跃。作为 CRNN 作者之一,其工作是「CRNN → 现代端到端 OCR」这条主脉络的源头之一;从场景文字到 MonkeyOCR 的演进,是本 Wiki OCR 研究谱系的重要一支。