通用大语言模型在文史领域中的应用:以云四库智能问答系统为例
摘要:本文以云四库智能问答系统为例,探讨了通用大语言模型在文史领域中的应用。首先,文章分析了当前通用大语言模型在文史研究中的两个关键局限:数据不足和专业性不足。接着,文章详细介绍了云四库智能问答系统的开发过程,包括平台的搭建、数据的整合和模型的训练。云四库系统基于阿里的通义千问和杭州深度求索DeepSeek大模型进行升级,特别强化了对人文领域知识的理解和生成能力。系统不仅能够回答具体的历史、文学、哲学等人文领域的事实
摘要:本文以云四库智能问答系统为例,探讨了通用大语言模型在文史领域中的应用。首先,文章分析了当前通用大语言模型在文史研究中的两个关键局限:数据不足和专业性不足。接着,文章详细介绍了云四库智能问答系统的开发过程,包括平台的搭建、数据的整合和模型的训练。云四库系统基于阿里的通义千问和杭州深度求索DeepSeek大模型进行升级,特别强化了对人文领域知识的理解和生成能力。系统不仅能够回答具体的历史、文学、哲学等人文领域的事实
摘要:客观、高效地评估文言文阅读难度是语文教育和国学传播领域亟待解决的重要课题。本文着眼于文言文阅读难度自动分级研究,首先构建了文言文分级语料库,并融合语言形式特征、浅层语义特征和深层语义特征构建机器学习模型;同时,探索了GPT-4o、DeepSeek-V3等大语言模型在该任务上的潜力。实验结果显示,基于融合特征的机器学习模型表现最佳,梯度提升模型的分类准确率达到96%以上;[1]大语言模型因缺乏背景知识,分类准确率
摘要:大容量古籍的文本结构化和知识体系化是当前古籍工作的重要范畴。然而,相关研究集中在目录层级,如何深入到文本内部是当前亟待解决的难题。LDA主题模型在大规模文档潜在主题识别中表现优异。本研究目的是探究其在类书等大容量古籍文本隐性知识体系挖掘和重构中的作用。本研究方法以《太平御览》为样本,通过LDA模型与情感词典进行主题与情感识别、依托IEMP权力理论建构隐性知识体系模型,再通过“大模型+prompts提示词”和Gr
摘要:汉语音义文献属于我国古籍中特殊且重要的一类,是汉语音义研究的核心文献。汉语音义研究首先需要从其中离析提取出音和义,进行匹配和判定。而作为古籍数字化的基础任务之一的自动分词,也是音义信息精准高效提取的关键。随着古籍数字化及数字人文相关技术的不断迭代,古汉语自动分词技术有了新进展。本文以唐五代佛典音义文献自动分词研究为切入点,提出面向佛典音义的词汇切分规范,通过微调训练得到唐五代佛典音义文献自动分词模型YinYiB
摘要:西夏文字是研究西夏历史文化的重要载体,因其字形结构独特、研究人员稀缺,其解读和研究面临诸多挑战。人工智能技术的发展为走出这一困境提供了新途径,但仍受限于标注数据稀缺的现状。本研究聚焦于低资源条件下的西夏文OCR与机器翻译两项任务。在OCR任务中,使用字体生成技术构造了训练数据,在仅使用500张真实标注图片的前提下实现了83.1%的准确率。在机器翻译任务中,结合大语言模型和西夏文辞书知识,实现了西夏文到汉语的对译
摘要:随着大语言模型(LLM)技术的快速发展和广泛应用,基于大语言模型的古诗文自动笺注展现出巨大的应用潜力。然而,迄今为止,尚缺乏对大语言模型在古诗文自动笺注任务中实际性能的系统性研究和科学评测。为此,本课题组对国内外综合能力较强的6个通用大语言模型在古诗文自动笺注任务中的表现进行了全面评估。首先,从四家出版社的古诗文笺注著作中选取2,529条笺注作为评测数据中的参考笺注,并使用提示词模板调用不同大语言模型的API生
摘要:为进一步提升古籍智能处理中不同粒度的实体,特别是复杂嵌套实体的识别精度,本研究提出一种融合代价敏感学习策略的实体识别方法,并以地方志文献为研究对象,开展实证分析。针对古文训练语料规模有限、实体类型多样、实体密度分布不均等挑战,选取大语言模型Qwen-7B和Chinese-Alpaca-2-7B,以及传统非大语言模型方法MRC和BERT-Span,作为基线模型,引入结合加权交叉熵损失的代价敏感学习机制,调整模型对
摘要:随着古籍数字化及数字人文的飞速发展,近些年诸多数字古籍整理平台于网络上涌现,并产生了广泛影响。其基本功能通常有图像文字转换、协助转换校对、协助文本格式处理、自动标点、文本对勘、其他相关功能,并设计有流程系统、合作系统;根据对各功能的支持情况,可对诸平台进行分类。数字古籍整理平台在古籍整理方面具有非常重要的意义,但是在校勘功能上却支持羸弱,应进一步建设加强。经全面梳理分析校勘的具体步骤,可见数字手段能全面应用于校
摘要:本文以《三国志》《华阳国志》《后汉书》为例,构建了三国史文献异文资源库[1],并探索了资源库的应用价值。资源库包括2,332对异文小句的映射库、异文变异类型统计数据库、异文词语替换知识库3个子库。在文本标注阶段,文献异文的标注体系及其异文编辑距离方法有助于界定异文句,增强异文标注的一致性。在资源库的应用阶段,文献异文资源库可以在5个方面发挥其作用:定量可视化分析史书史志的叙事异同、作为异文自动发现的数据集、总结