0

0

什么是TEI(文本编码规范) 学术XML标准

畫卷琴夢

畫卷琴夢

发布时间:2025-12-18 15:40:02

|

394人浏览过

|

来源于php中文网

原创

TEI是一套面向人文学科的国际通行学术XML编码规范,以结构化语义标签整合文本与元数据,强制包含四大元数据区块,采用模块化设计并由P5 Schema严格约束,根元素为,分和两大部分,广泛应用于古籍整理、版本比对与数字出版。

什么是tei(文本编码规范) 学术xml标准

TEI(Text Encoding Initiative,文本编码倡议)不是一种工具或软件,而是一套面向人文学科的、国际通行的学术XML编码规范。它用结构化、语义明确的XML标签,把文本内容和元数据(如作者、年代、语言、版本、手稿状态等)一起打包保存,让古籍、信札、诗歌、词典等复杂文本既能被人读懂,也能被机器识别、检索、分析和长期存档。

为什么是“学术XML标准”

因为TEI不是通用XML,而是专为学术研究定制的XML框架:

  • 所有标签都有明确定义的人文语义,比如表示手稿中无法辨认的文字,旧写法校正后记录校勘过程;
  • 强制包含四大元数据区块:fileDesc(文献描述)、encodingDesc(编码说明)、profileDesc(内容特征)、revisionDesc(修订日志),确保每份数字文本可溯源、可复现;
  • 采用模块化设计,支持按需组合——研究简牍可用“手稿描述模块”,编纂词典则启用“词典编码模块”,不强求全功能;
  • 所有标签定义由TEI联盟通过XML Schema(P5版)严格约束,任何TEI文件都可通过验证工具(如Trafilatura、Oxygen)自动校验是否合规。

它的基本结构长什么样

一个合法TEI文档必须以为根元素,内部严格分为两大部分:

  • :存放全部元数据,包括标题、作者、创建时间、语言标识(xml:lang)、关键词、编码依据等;
  • :承载正文内容,通常再细分为(前言/目录)、(主体)、(附录/索引),层级清晰,便于分段处理与多模态关联(如图文对照)。

例如,一段带异体字标注的古文可能这样编码:

Teleporthq
Teleporthq

一体化AI网站生成器,能够快速设计和部署静态网站

下载

其字作,见于青木川叙事

它在真实学术场景中怎么用

TEI不是纸上标准,而是驱动实际项目的底层协议:

  • 哈佛《中国历代人物传记资料库》(CBDB)用TEI管理数万条人物生平与文献出处;
  • 牛津莎士比亚项目将早期四开本、对开本扫描件+校勘注释统一转为TEI,支撑版本比对与文本挖掘;
  • 秦汉简牍整理团队用等标签标记残缺与补字,实现考古信息与文本逻辑同步存档;
  • 学者用XSLT将TEI批量转成HTML供在线阅览,或转成LaTeX生成出版级PDF,全程无需人工重排版。

它和普通XML有什么不同

关键不在语法,而在意图和约束力:

  • 普通XML允许任意自定义标签,但缺乏语义共识,可能指人名、地名或书名;TEI中各司其职;
  • 普通XML不强制元数据,TEI要求teiHeader完整且结构化,否则无法通过验证;
  • 普通XML没有领域知识嵌入,TEI内置200+种文本类型模板(戏剧、日记、法律文书等),直接复用即可避免重复造轮子。

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

616

2023.06.14

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

655

2023.06.21

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

470

2023.07.31

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

245

2023.08.01

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2895

2023.08.11

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

506

2023.08.11

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

312

2023.08.31

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

426

2023.09.01

Java JVM 原理与性能调优实战
Java JVM 原理与性能调优实战

本专题系统讲解 Java 虚拟机(JVM)的核心工作原理与性能调优方法,包括 JVM 内存结构、对象创建与回收流程、垃圾回收器(Serial、CMS、G1、ZGC)对比分析、常见内存泄漏与性能瓶颈排查,以及 JVM 参数调优与监控工具(jstat、jmap、jvisualvm)的实战使用。通过真实案例,帮助学习者掌握 Java 应用在生产环境中的性能分析与优化能力。

19

2026.01.20

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Bootstrap 5教程
Bootstrap 5教程

共46课时 | 2.9万人学习

AngularJS教程
AngularJS教程

共24课时 | 2.8万人学习

CSS教程
CSS教程

共754课时 | 21.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号