规定原文与数据来源
一、《通用规范汉字表》
出处:国务院关于公布《通用规范汉字表》的通知(国发〔2013〕23号)及附件字表;附件字表 PDF:gov.cn/gzdt/att/att/site1/20130819/tygfhzb.pdf
《通用规范汉字表》公布后,社会一般应用领域的汉字使用应以《通用规范汉字表》为准,原有相关字表停止使用。
字表《说明》第二条:
本表收字 8105 个,分为三级:一级字表为常用字集,收字 3500 个……二级字表收字 3000 个,使用度仅次于一级字。……三级字表收字 1605 个,是姓氏人名、地名、科学技术术语和中小学语文教材文言文用字中未进入一、二级字表的较通用的字……
字表《说明》第七条:
本表在以往相关规范文件对异体字调整的基础上,又将《第一批异体字整理表》中“皙、喆、淼、昇、邨”等 45 个异体字调整为规范字。
本站的 8105 字数据是怎么来的
- 中国政府网附件 PDF 是 137 页扫描件,没有文字层,没法直接抽出文字。本站没有凭记忆录入任何一个字。
- 逐字数据取自 Unicode 联盟官方 Unihan 数据库(Unicode 18.0.0)的 kTGH 字段,这个字段记录每个字在《通用规范汉字表》里的序号:unicode.org/Public/UCD/latest/ucd/Unihan.zip。
- 序号 1–8105 完整连续、没有重复。按《说明》第二条的分级数,序号 1–3500 为一级、3501–6500 为二级、6501–8105 为三级。
- 本站把 kTGH 序号与官方 PDF 抽样页逐字比对:一级字表第 1117–1344 号(PDF 第 13 页)、三级字表第 7617–7844 号(PDF 第 43 页)全部一致。
- 数据文件在本站源码
src/data/tygfhzb.json,生成脚本与校验记录在scripts/build_data.py、sources/PROVENANCE.md。
二、户口登记用字
出处:公安部《户口居民身份证管理工作规范(试行)》(公通字〔2021〕12号)第五十一条
第五十一条 除姓氏外,公民姓名登记应当使用《通用规范汉字表》中的汉字。
第九十二条 公民因婴儿取名需要,公安派出所可以提供本市、县范围内重姓名人数查询服务。
出处:教育部等十二部门关于贯彻实施《通用规范汉字表》的通知(教语信〔2013〕2号),第三部分(六)户籍和民政管理领域:
公民在申报户口登记、申领居民身份证时,姓名登记项目应当使用规范汉字填写。《通用规范汉字表》公布后,新命名、更名的人名用字应使用《通用规范汉字表》中的字。
本站据此怎么判:名字(不含姓)里的字不在字表内,标红「不在字表内」;姓氏不在字表内,只标「需留意」,因为第五十一条写明了「除姓氏外」。两种情况下,户籍系统能否录入都以当地派出所为准,本站不下登记结论。
三、繁体、异体提示
表外字对应的规范字,本站取自 Unihan 数据库的繁简对应(kSimplifiedVariant)和异体对应(kSemanticVariant、kZVariant):Unicode Unihan 数据库 Variants 字段(繁简与异体对应,非字表附件 1 原表)。
这不是字表附件 1《规范字与繁体字、异体字对照表》的逐条转录(附件同样是扫描件,本站没有转录)。所以本站只写「是繁体字」「可能是异体字」作提示;数据里找不到对应关系的表外字,标「本站判不了」。一个字在不在字表内,只看字表本身,不受这项提示影响。
四、多音字
读音取自 Unihan 数据库 kXHC1983 字段,即《现代汉语词典》1983 年版所列读音:Unicode Unihan 数据库 kXHC1983 字段(《现代汉语词典》1983 年版所列读音)。一个字列有两个及以上不同读音,本站判为多音字,并请你选定名字里读哪个。
8105 字里有 7586 字有这项记录,其余 519 字(多为三级字)本站判不了是不是多音字,会明确标出来。1983 年版之后部分字的读音有调整,最终读音以现行字词典为准。
五、声调搭配
本站按每个字确定的读音取声调(一声到四声、轻声),姓和名连起来比对。全部字声调相同时提示「读起来偏平」;只要有一个字读音没确定(多音字没选、表外字或缺读音数据),声调这一项就标「本站判不了」。这是本站自己的比对方法,不是任何官方规定。