数智时代中国文学史数据库建构
【数智时代与古典文学】
前不久,陈文新教授在《光明日报》(2026年8月3日13版)刊发文章,提出建设中国文学史知识数据库的倡议。这一思路,和笔者十几年来持续探索、推进的数据库建设工作不谋而合。谨结合自己的实践体会,谈谈对建设中国文学史知识数据库的几点思考。
建设文学史数据库,首先要考虑我们需要什么样的数据库。进入数智时代,文学研究越来越走向数据化、可视化,而可视化的基础之一,是扎实、系统、可用的数据。现在学界普遍使用的各类古籍数据库,其实大多只是数字化古籍资源库,主要用来查原文、找文献,并不是真正意义上的研究型数据库。这类数据库大多只能满足文献检索的基本需求,很难直接提供可统计、对比、分析的文学研究数据。即便资源库自带统计结果,数据也大多是零散、孤立的,不成体系,难以直接拿来统计分析。这也导致我们日常教学和科研中,很多最基础、最常用的文学史数据,难以快速查到、精准获得。举个例子:我们现在可以很方便地检索《全唐诗》《全宋词》,却很难快速得到一些基础统计数据,如唐代初、盛、中、晚四个阶段,诗歌数量分别是多少?到底是初盛唐诗歌更盛,还是中晚唐更多?《全宋词》里,哪些词调使用最多、作品最多?哪些词调属于孤调、存词极少?这些看似简单的基础数据,现有古籍平台基本无法直接给出。正因为基础数据匮乏,北京两位长期从事文学数字化研究的知名学者,也曾专门向笔者咨询这类问题。笔者也需要重新梳理、逐一统计,无法立刻给出准确答案。此事说明,建设一套专门服务文学史研究的知识数据库,十分必要和迫切。这正是陈文新教授所期待的、能够真正服务学术发展、保障文学史知识安全的大型数据平台。
相比于目前通行的各类古籍资源库,未来的中国文学史知识数据库,要有五个方面的突破,以弥补现有平台的不足。
第一,打通古今,突破断代界限。传统数据库大多只聚焦古代文学,隔断了古今文学的关联。新的数据库,既收录古代文学,也应涵盖现当代文学,完整呈现中国文学从古至今的发展脉络。
第二,融通中外,拓宽空间视野。数据库不再局限于本土文学,也适度纳入世界华文文学和相关域外文学资源。纳入现当代文学、华文文学和域外文学,并不是抢占其他学科的领地,而是古代文学研究的内在需求和自然延伸。中国古代文学从来不是只供展陈的古董,它一直在现当代持续传播、不断被继承,也深刻影响着海外华文创作与域外文学发展。只有贯通古今、兼顾中外,才能完整看清中国文学的发展脉络与世界影响,既丰富国内文学研究资源,也助力中外文学交流与文明互鉴研究。
第三,兼容雅俗,丰富文体类型。传统文献体系重雅轻俗,很多民间、通俗文学长期不受重视。新的数据库要改变这种偏向,既收录诗、词、文、赋等正统文体,也应全面吸纳小说、戏曲、歌谣、说唱等通俗文学、民间文学形态,真实还原中国文学雅俗并存、多元共生的本来面貌。
第四,包容多民族文学,完善中华文学整体版图。以往文学数据库多以汉文学为主,对其他民族文学关注不足。中华文学是由多民族共同创造的,因此新数据库要同时纳入多民族史诗、民间韵文、口头故事等各类文学资源,完整呈现中华民族共同体丰富、厚重、多样的文学格局。
第五,兼顾史料与研究,完善文献层次。传统数据库大多只收录古代文学作品,缺少现代研究成果。新的数据库应既包含历代文学作品和评点文献,也系统收纳20世纪以来各类文学史著作、研究专著、校注成果、期刊论文等学术资料。文学研究不能只有原作而没有研究。只有打通创作、批评与学术研究,才能形成完整的文学史知识体系。
明确了文学史知识数据库的建设定位与突破方向后,接下来就要思考,究竟该搭建什么样的整体框架,既方便实用,又兼具学理性与体系性,能够如实反映中国文学自身的发展脉络、文化生态与知识逻辑,契合中国文学自主知识体系的建设需求。总体来看,这套数据库应当具备四个核心特征,也可视为四条基本建设原则。
一是完整性。数据库需要覆盖跨时代、跨地域、跨民族、跨文体的中国文学资源及相关研究成果,坚持“大文学”理念,既包含传统文人雅文学,也吸纳民间俗文学;既收录古代文学经典,也涵盖现当代文学创作;既能清晰呈现本土文学的发展脉络,也完整记录中国文学的海外传播与接受历程。
二是层次性。文学史知识广博繁杂、交叉渗透,极易出现归类混乱、边界模糊、内容重叠的问题。因此数据库建设必须层次清晰、分类规整。传统目录学典籍如《四库全书总目》《中国丛书综录》,体例严谨、条理分明,四部之下分类属,各类之下又依时序编排,井然有序,既可让人整体把握典籍体系,又能精准检索具体书目,实现学理性与实用性的统一。借鉴这一思路,理想的中国文学史知识数据库,也要让使用者通过整体框架读懂中国文学史的知识体系与内在逻辑,精准检索各类文献史料与研究数据。
三是灵活性。数据库兼具静态固化与动态活化的双重属性。从文献形态来看,完整的文献文本可以拆解为独立的知识点与数据单元,实现由固态文献向活态知识数据的转化。从数据更新来看,整套数据要规范定型、体系稳定,同时可动态迭代、持续优化,保障数据的前沿性与科学性。学术研究始终处于不断推进的过程,新材料的发掘、研究方法的更新、研究视角的拓展,都会修正、完善甚至更新既往学术结论,许多存疑问题也会随研究推进得到新的解答,这就要求数据库具备可持续迭代优化的能力。从数据使用来看,数据库各类板块应均可自由拆分、灵活重组,时间、地域、人物、作品、主题、物象、文体、写作手法等基础要素,可根据不同研究需求自由搭配、多维组合,从而适配多元化研究场景,发现新的问题,生成新的知识。
四是智能化。数据库兼具基础检索统计与智能分析能力,可实现多元检索、自动统计、可视化呈现,同时支持文本对照、自动笺注、语义分析、知识问答等智能功能。简言之,这套数据库是兼具文献资源、知识体系与结构化数据的专业学术平台。
基于以上原则,笔者提出一套“四维三层多类”的文学史知识数据框架,作为数据库建设的参考范式。所谓“四维”,即作家、作品、传播、接受四大维度,完整覆盖文学活动开展与文学价值生成的全过程。作家创作出作品,必须经过传播与读者接受,其审美价值、文学意义才能最终落地。如同社会生产,产品经由生产、流通、消费全过程,最终实现完整价值,文学活动也是如此。
所谓“三层”,即底层数据要素、中层分类体系、顶层整体框架。底层为最小的微观知识颗粒,依据文学史知识分类标准,将传统文献文本转化为可识别、可标注、可统计、可挖掘的标准化数据单元;中层承担归类梳理、分层编列的功能,将海量零散的基础要素有序聚类编排,形成层级清晰的知识类目;顶层即为定型完备的“四维三层”整体架构,确立数据库统一的建设标准、分类规则与知识范式。
所谓“多类”,即每一核心维度之下,再逐级细分多层类目,实现精细化、体系化归类。在作家维度,可分为作家个体与作家群体两大板块。作家个体数据分为客观信息与主观信息两类:客观信息包含作家生卒、籍贯、行迹、交游、外貌特征、作品存佚数量等可考证的史实资料;主观信息包含作家性格心理、思想情感、创作主张、审美个性、艺术风格等内在特质,同时纳入后世对作家的文学史地位、创作贡献、文学影响等评价的内容和数据。作家群体则按时段、地域、文体、交游关系、创作倾向等维度,划分不同作家流派与创作群体,开展整体数据归类与统计分析,清晰呈现不同时代、不同地域、不同文体的作家作品体量与创作风貌。
作品维度,遵循先分后合的思路,整体分为单篇作品与作品集两大类别。单篇作品细分为载体、形式、内容、影响四个层级。载体层,依据物质形态,分为纸本文献、电子媒介等;依据文献来源,分为别集、总集、诗文评及其他四部文献,以及近现代报刊、网络平台等出处类型。形式层,细化为文体体制、语言声韵、篇章结构、表现手法四大类;内容层,涵盖题材物象、情感意绪、主题意蕴及妙理哲思等由表及里的多层内涵;影响层,主要反映作品的选录、品评、引用、化用、改编等传播接受情况。各层级再逐级细分,形成精细化、标签化、结构化的数据要素。作品集分为别集、总集两类,别集可细分为行款牌记、编刻时间、编刻地点、编刻者等版本信息,以及分卷体例、编次结构、篇目数量等本体信息。
传播维度,可细化为传播主体、传播对象、传播媒介、传播方式、传播地域(域内、域外)等类目,完整呈现文学文本与文学观念的传承路径。接受维度,依据接受主体差异,分为批评家、创作者、普通大众三类,不同主体对应不同接受形态:古代批评家以文本评点、题跋、品评为主,现代研究者以专题论著、期刊论文、学术综述等研究成果为主;创作层面的接受则体现为追和、拟作、引用、化用、改编等创造性转化行为。
当然,这套框架目前只是初步建构的理论雏形,各类目细分标准、要素拆解规则、语义判定体系、数据标注规范,有待学界共同研讨、打磨完善。
建设中国文学史知识数据库,既能推动文学研究走向精细化、结构化和数据化,更能助力中国文学自主知识体系的建构与创新。近年来,中国文学自主知识体系研究已然成为学界热点,但现有成果多停留在宏观的历史梳理与学理反思层面,缺乏可落地、可操作的完整体系建构。尽管20世纪以来已有诸多文学理论、文学史研究成果,但要提炼出一套兼容中国文学史、批评史、学术史的完备知识体系难度很大,尤其在知识要素切分标准、层级细分方案等关键问题上,现有文学、文学史学与文献学理论难以完全适配。相较易于规范的客观数据,文学研究所需的主观分析类数据,更迫切需要学理支撑与统一的体系标准。唯有依靠学界集体参与、持续打磨迭代,才能构建贴合中国文学生态、适配本土学术话语、契合数智时代需求的自主知识体系与数据范式,为数智时代中国文学研究创新与中外文明互鉴,提供长效坚实的数据支撑。
(作者:王兆鹏,系四川大学中华文化传承与全球传播数字融合实验室讲座教授)