如果AI确实通过语言形式了解复杂语义,学会了更好的推理,且朝着更复杂、真实的世界前进,那么,给世界留下一个怎样的AI——它能不能读懂文学,能不能理解暮秋时分诗人的身体感应,这便是新一代人文学者不可回避的责任和义务。在面对先辈们充满褶皱、立体复杂的文学遗产,其话语权不应该完全出让给机器,和机器的设计师。既然AI确实拥有重塑我们未来知识结构的可能性,那么,督促AI朝着更切实继承文学遗产,监测AI对文学的能力到了何处,是否有朝着"文学是人学"的理解方向进步,这些应该是(至少一部分)人文研究者需要致力于探索的志业。假使文学研究学术共同体以AI目前缺乏身体、情感、记忆、意识为由,一票否认其对文学的阐释力,漠不关心AI对文学研究的潜力,那么我们行将看到的未来,更可能是那个不曾接触文学的世界驱逐文学,而不是相反。

项目与成果

2026.01 – 至今

SongPanda:面向真实研究场景的古籍 OCR 模型与评测基准

古籍垂直领域 OCR

第一作者 · 《数字人文》(C 集)录用待出版 · PaddleOCR 全球衍生模型挑战赛冠军(81.5 分)

  • 提出古籍图像合成数据方法,构建 20,000+ 张训练集;结合版本学知识构建 SongPanda-Bench 测试集,覆盖 100+ 种刻本来源与 356 张专家精标图像。
  • 基于合成数据微调 Qwen2.5-VL-7B 与 PaddleOCR-VL 1.6,在 SongPanda-Bench 达到 SOTA;以 81.5 分获 PaddleOCR 全球衍生模型挑战赛冠军。
SongPanda 复杂版面古籍识别示意
2025 – 2026

订书机:古籍自动校勘多智能体系统

古籍 Agent(AI for humanity science)

第一作者 · 优胜奖(海峡两岸暨港澳大学生计算机创新作品赛,省一等奖级)· 入选第五届东亚古籍数字人文国际会议

  • 基于 LangGraph 构建多智能体协作校勘 Agent,覆盖异文发现、考证到校勘记生成;双 Agent 辩论与引证核查使其与人类专家一致率由 51% 提升至 82%。
  • 全量 115 条古籍引证核实通过率为 100%;在中山大学《文献学》课程同题作业中,端到端耗时约为人工的 1/30。
订书机系统架构
2026

EvaHan 2026:古籍多模态 OCR 与版面分析国际评测

古籍垂直领域 OCR

三等奖 · LT4HALA @ LREC-2026

  • 基于 Qwen2.5-VL-7B 设计数据预处理、合成增强与课程式微调方案;印刷体 CER 由 10.0% 降至 2.0%,手写 CER 由 22.0% 降至 10.0%,版面分析 mAP 提升 10.9 个百分点。
2024 – 2025

BERT 视角下的中古诗风嬗变研究

计量文体学

计量文体学

  • 以 SikuBERT 与 Triplet Loss 计算曹操至陈叔宝共 68 位诗人的风格向量,再以余弦相似度和 K-means 聚类分析诗风演变。仅凭文本本身,机器聚类结果较好符合文学史常识,并为陶渊明体文本来源等问题提供量化补充。
诗人聚类结果图
2026

1840:中国古代知识人语言模型

古籍 Agent(AI for humanity science)

个人实验

一个反问式的实验:如果一个语言模型的全部语料都锚定在 1840 年之前,它的输入输出只有文言文,知识边界止步于传统知识系统,它会用怎样的方式回应被译成文言的现代问题?

教育产品

桃源学境 · 将无同

AI 产品

文言文情境化学习 AI 平台

  • 通过拍照上传、逐句注释、考点分析和错题归档支持文言文学习。78 名中学生的被试内对照实验显示,平台提升短期学习效率,并在一周后记忆保持中呈现优势。
  • 已积累 1,000+ 名种子用户,获《人民日报》《光明日报》等媒体报道。
桃源学境整体工作流程图
2025.08

CCL2025-Eval「争鸣」评测:古汉语文学推理

古籍 Agent(AI for humanity science)

第一作者 · 赛道第一 · 系统报告收录于 CCL2025 论文集

  • 结合古代文学专业知识构建古汉语 CoT 数据集,系统比较思考与非思考两种推理范式。

教育背景

2025.09 – 2028.06

中山大学

中国古代文学 · 硕士在读

2019.09 – 2025.06

华东师范大学

中国语言文学 · 拔尖班

校优秀毕业生。修读中国文学史、中国文学批评史、历史文献导读、文献学、数字人文、自然语言处理、计算语言学、机器学习、线性代数等课程。2024.09 – 2025.01 于台湾政治大学交换,修读机器学习概论等交叉课程。

经历

2026.03 – 2026.09

腾讯 · WXG · 微信读书

AI 产品经理(实习)

独立负责网络文学作品文笔质量自动评估系统,产出为发明专利《一种基于语言模型持续预训练与机器学习融合的网络文学作品文笔质量评估方法及系统》(申请中);同时负责 WXG 内部 AI + 办公软件的开发,围绕 Agent 在办公场景的能力,独立完成"提出需求—开发上线—数据验证"的需求闭环。

2025.02 – 2025.06

科大讯飞 · AI 语音合成部

资源工程师助理(实习)

制定粤语、四川话及多语种语言规则与数据清洗增强规则,清洗 10 万+ 条语料;完成 7 篇多模态语音模型技术报告。