北京大学词类标记集(40+tags)——《人民日报》标注语料库

/ NLP / 没有评论 / 686浏览

标注集列表

代码名称帮助记忆的诠释
Ag形语素形容词性语素。 形容词代码为 a ,语素代码 g 前面置以 A。
a形容词取英语形容词 adjective 的第 1 个字母。
ad副形词直接作状语的形容词。 形容词代码 a 和副词代码 d 并在一起。
an名形词具有名词功能的形容词。 形容词代码 a 和名词代码 n 并在一起。
b区别词取汉字“别”的声母。
c连词取英语连词 conjunction 的第 1 个字母。
Dg副语素副词性语素。 副词代码为 d ,语素代码 g 前面置以 D。
d副词取 adverb 的第 2 个字母 ,因其第 1 个字母已用于形容词。
e叹词取英语叹词 exclamation 的第 1 个字母。
f方位词取汉字“方” 的声母。
g语素绝大多数语素都能作为合成词的“词根”,取汉字“根”的声母。 由于实际标注时 ,一定
标注其子类 ,所以从来没有用到过 g。
h前接成分取英语 head 的第 1 个字母。
i成语取英语成语 idiom 的第 1 个字母。
j简称略语取汉字“简”的声母。
k后接成分
l习用语习用语尚未成为成语 ,有点“临时性”,取“临”的声母。
m数词取英语 numeral 的第 3 个字母 ,n ,u 已有他用。
Ng名语素名词性语素。 名词代码为 n ,语素代码 g 前面置以 N。
n名词取英语名词 noun 的第 1 个字母。
nr人名名词代码 n 和“人(ren) ”的声母并在一起。
ns地名名词代码 n 和处所词代码 s 并在一起。
nt机构团体“团”的声母为 t,名词代码 n 和 t 并在一起。
nx非汉字串
nz其他专名“专”的声母的第 1 个字母为 z,名词代码 n 和 z 并在一起。
o拟声词取英语拟声词 onomatopoeia 的第 1 个字母。
p介词取英语介词 prepositional 的第 1 个字母。
q量词取英语 quantity 的第 1 个字母。
r代词取英语代词 pronoun 的第 2 个字母,因 p 已用于介词。
s处所词取英语 space 的第 1 个字母。
Tg时语素时间词性语素。时间词代码为 t,在语素的代码 g 前面置以 T。
t时间词取英语 time 的第 1 个字母。
u助词取英语助词 auxiliary 的第 2 个字母,因 a 已用于形容词。
Vg动语素动词性语素。动词代码为 v。在语素的代码 g 前面置以 V。
v动词取英语动词 verb 的第一个字母。
vd副动词直接作状语的动词。动词和副词的代码并在一起。
vn名动词指具有名词功能的动词。动词和名词的代码并在一起。
w标点符号
x非语素字非语素字只是一个符号,字母 x 通常用于代表未知数、符号。
y语气词取汉字“语”的声母。
z状态词取汉字“状”的声母的前一个字母。

参考文献

俞士汶, 段慧明, 朱学锋, 等. 北京大学现代汉语语料库基本加工规范[J]. 中文信息学报, 2002, 16(5): 51-66.