Skip to content

《星号之下——语言史话》欠账清零 749/749(承接 main 上 8-03 那版初稿) - #230

Open
oratis wants to merge 25 commits into
mainfrom
claude/language-history-book-0bef06
Open

《星号之下——语言史话》欠账清零 749/749(承接 main 上 8-03 那版初稿)#230
oratis wants to merge 25 commits into
mainfrom
claude/language-history-book-0bef06

Conversation

@oratis

@oratis oratis commented Aug 4, 2026

Copy link
Copy Markdown
Owner

main 在 8 月 3 日由 4c179af 入库过一版《星号之下——语言史话》:391 条欠账,一条未清,是初稿状态。

本 PR 把它推到完成:749 条欠账全部结清,待核 0,成书前 0。

51 个文件 · +1,543 / −607 · 全部在 语言史/ 之内

欠账机制

书稿每章末尾一个 HTML 注释区块,凡没核实的说法都写成 - [ ],核实后打勾并附出处。规矩三条:

  • A 型 查证属实 → 打勾 + 出处
  • B 型 查证发现正文有错 → 先改正文,再打勾
  • C 型 查不到 → 保持未打勾,写下试过哪些检索路线

条目数从 391 涨到 749,是因为清账过程中一条常常裂成三条(原条目问的是「这个数对不对」,查下来发现该问的是「这个数是谁的口径」「另一家给多少」「正文那句该怎么改」)。

改掉的实质错误

每一处都先核后改,不是润色。

  • 第 5 章:原文「学界有两种读法……两种读法都有支持者」——查下来根本不是两派之争,「人名说」与「说不准」出自同一页(Nissen/Damerow/Englund 1993: 36),Renn 在马普开放获取那篇的脚注里直接写 his name is a poetic license
  • 第 23 章:原文把塞莱佩特语那个故事系在 Laycock 1982 上——从 Wayback 取到原件通读 33–38 页,故事不在这篇里;而真在里面的乌伊赛例子,那个机制是作者自己的推测(原文写 I believe that…),不是田野记录
  • 第 28 章:原文说「儿童接触的语料里频率比假定的高」——普勒姆数的其实是《华尔街日报》头五百个疑问句;儿童语料库给的是「占全部疑问句不到百分之一」
  • 第 4 章:撤掉「第二处争议来自聋人社群自己」这个坐实不了的归属
  • 第 28 章:「生成语法成了世界上最大的语言学流派」→「影响最大的流派之一」

数字改正(末轮打通 Ethnologue 之后):

汉藏语系 约 450 门 463
亚非语系 约 380 门 391
印欧语系 约 446 门 456
爪哇语 约 8000 万 母语者不到七千万
濒危比例 43% 44%
孤立语言 184 183

爪哇语那处最实在:原数高于 Ethnologue 记的总使用者数 69.2M——按母语者算偏高,按含二语的总数算也偏高。

这些改动没有一处是把话说得更满——好几处是把原本站得住的说法,改成了站得更低但更牢的说法。

打通 Ethnologue

最后 13 条欠账全卡在同一处:Ethnologue 第 29 版。curl 与 WebFetch 一律 403,十几轮没解决。换成应用内的真浏览器,直接就通了。

一手取得:ethnologue.com 的「7,170 languages are in use today」原句、免费的家族浏览页各语系语言数、Ethnologue 200(2026 版)名单;Glottolog 5.3 走它 DataTables 的服务端接口读 iTotalDisplayRecords,得到 Top-level family 246、Isolate 183。

顺带查出一处口径违规:序章把 7,170(Ethnologue)与「两百四十多个语系/一百八十多门孤立语言」(Glottolog)并排,两个数据库混用却未注明。核下来书里原记的数字完全正确,缺的只是出处——现已写明两个数据库的分工,并写进写作规范 §23 口径表。

一条没糊弄过去的边界:单语言的母语者数确在订阅墙后($480/年)。免费的 Ethnologue 200 只给 L1+L2 总数,按 §36② 不能与本书的母语者数并排比。本轮只把它当上界用——书里每一处母语者数都通过了上界检验(如他加禄语「母语者约 2800 万」对总数 87.1M,差额正是把菲律宾语当第二语言的那批人)。这一条原样写在各章欠账里,没有说成「已核实」。

全书核验

检查 结果
欠账 749 清 / 待核 0 / 成书前 0
篇数与字数 35 篇 · 223,993 字
HTML 注释配对 35/35
frontmatter words 与实测 35/35 精确一致
跨章引用 551 处,0 处指向不存在的章
裸星号(重构式未转义) 0
正文占位符 0
人物谱 288 条,0 重名 · 0 空速写 · 0 覆盖缺口
语系谱按章销账 全部打勾
时间线 170 行,按年顺序正确

新增两个工具

  • tools/refresh_words.py —— 回填各章 frontmatter 的 words。此前没有任何脚本会刷它,35 篇里 16 篇对不上,最大差 1,241 字
  • tools/roster_check.py —— 直接扫正文里「中文名(拉丁原名)」式的正式引入,逐个对人物谱查。旧检查只比对 frontmatter 的 people 字段,查不出正文点名而谱内无条目的人——一跑就查出 11 处(违反写作规范 §19)

修掉两个工具 bug

  1. refresh_readme.py 的「当前正文字数」十轮没刷新过:正则 [\d\s]+ 不含逗号,配不上目标数 240,000re.sub 静默什么都没替换,而脚本每次都报「已刷新」。已修并加 assert
  2. build_html.py 自己写了一套字数统计,没去 Markdown 记号——用的是已废弃的旧口径,与 README 差 11,148 字。已改为共用 measure.count_text

关于合并冲突

本分支从 a717dd3 分叉,早于 main 上 语言史/ 入库的 4c179af,两边各建了一次同名目录 → 49 个文件 add/add 冲突 → GitHub 造不出 merge ref,pull_request 工作流根本不触发(这就是此前 checks=0 的原因,不是 workflow 配置问题)。

已并入 main 并解掉:语言史/ 全部取本分支版本(已核实是严格超集,且 main 上该目录自入库后再无提交);.gitignore 取 main 版(它覆盖两本书 × 三种格式,是超集)。

🤖 Generated with Claude Code

oratis and others added 24 commits August 3, 2026 22:55
六卷 33 章加序章终章共 35 篇,约 22.0 万字。此前整个目录 untracked。

清欠账轮(2026-08-03 第二班次收尾):
- 749 条欠账已清 562(75%),待核 116、成书前 71
- 18 组逐章清账全部跑完,另 4 组带累积错误模式做第二遍扫尾
- 每组回报后用 debt_report.py 对数,不采信自报

高发错误模式「挑对论点更顺的说法」抓到十处以上,例如:
- 终章《绵羊和马》五版对照表,1997 那一行原书查无,为网络流传物,已撤
- 第 28 章结构依存实验只引 Crain & Nakayama 1987,漏 Ambridge 等 2008 的复制失败
- 第 18 章希伯来语「约九百万」夹在母语者 660 万与含二语 1060 万之间,两头都不是
- 第 15 章印欧语系「46 亿」(含二语)与汉藏「14 亿」(母语者)并排比

跨章收口:CLV 误译(里海→高加索—伏尔加河下游)、博阿老太所属语言、
Kenneth Hale 与 John R. Ross 两处同名撞车、人口口径全书统一为母语者优先。

人物谱新增 66 位:速写 66/66 写完,年份 62 位一手核实,
四条冲突已裁(罗德 1591→1593、里德林格 1883→1882、贾格纳特→1695-09-23)。

写作规范 §22 补入上限例外:清欠账补入的限定词、双方并列与出处范围
不计入 6500 字上限判断;下限不放宽。

星号之下-全书.html 为 build_html.py 生成物,已入 .gitignore。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
- 新脚本 tools/refresh_words.py:回填各章 frontmatter words(此前无脚本会刷此字段,35 篇里 27 篇过时)
- 人物谱补 11 位(塔尔博特、崔万理、周时经、卢戆章、蒲立本、图帕伊亚、库克、雷兰、夏普、皮艾卢格、马德雷尔)
- 时间线补 16 条(第 8、15、21 章),全表时序复验通过
- 申叔舟速写与第 9 章订正后的表述对齐(辽东十三趟须打折)
- 连带修掉三处活的旧口径:语系谱印欧语系、第 25 章正文、第四卷卷细纲的「46 亿」→ 母语者 34 亿
- 全书提纲:母题 4 章号串补 3、第 15 章一句话改口径、全书规模改 22.0 万字

欠账 562→584(78%)

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
正文改动(三处,均为查实后的订正):
- 第 24 章「今天还有使用者的四百到五百门」→「各家从六百多门数到逾一千门」
  仅美国一国即 199 门在用(Ethnologue),南美连中美现存约 420 门,四五百落在所有来源之外
- 第 30 章洛日班语「流利使用者是两位数」→ 如实转述来源(条目只给 >5)
- 第 19 章「一身鱼腥味的亲戚」补出来历:该词 1879 年首见于巴诺齐替雷维代言、
  1884 年又被安到万贝里头上,论战双方实际都用敬语——是一桩都市传说

考据清掉的要项:
- 克罗内贝格确为聋人(1930-2022,十岁失聪),第 30 章「两位聋人同事」成立
- 库辛泥板三个「打架」的数字实为同一块泥板的三种单位(CDLI 5617⅕ N1 ≈ 134,813 升)
- 米兰会议聋人代表数「一到三」与四位具名,与第 30 章逐字相符
- 皮安塔多西 lingbuzz v1 = 2023 年 3 月,第 33 章「同一个月」成立
- 金田一京助 1882-05-05–1971-11-14,并佐证第 25 章知里幸惠的经过

欠账 562→602(80%);02、03、19、22、26 五章已清零

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
再清 7 条,含:
- 克林贡语考试认证坐实(四级,最高一级至今无人拿到)——细节已补入第 30 章正文
- Goddard & Bragdon 1988 逾 150 件手稿,支持第 32 章「收了一百多件」
- 美洲语系计数坐实(Glottolog 4.1 北美 73 + 南美 108 = 181)
- 梅祖麟、济州语、图帕伊亚十幅水彩、罗尔斯顿生年等

剩余 69 条按「为什么还没清」分类:
  41 已写检索路线 · 10 原刊/纸本/限借 · 9 付费墙 · 6 公开资料确实不载 · 3 需专门数据库

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
人物谱 202 → 265 条:补入 63 位(各章 people 的覆盖缺口现为零)
时间线 124 → 164 条:补 40 条,二/三/四节时序全部复验通过

正文订正两处:
- 第 18 章「阿马尔奈书信全部用阿卡德语写成」→「绝大多数……不是全部」
  第 13 章早已查实 EA 24 是胡里语、阿尔扎瓦二信是赫梯语,而那条线索正是第 13 章的起点;
  冲突挂在第 13 章欠账里没人能改第 18 章,因为责编只准动自己那两章
- 母题 3「外行破的局」补入第 11 章(拉斯克徒步走到印度、格林编童话、
  维尔纳是失业的图书馆员、格拉斯曼是中学教师)

译名统一:人物谱「伯克」→「伯科」(全书四处作伯科,人物谱是唯一异写)
待考记录:阿克巴那座「哑屋」en.wikipedia 完全未载,已记进人物谱该条

欠账 609→636(85%);成书前 71→44

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
体例定案:外语词形取同一语法层 · 两河年代取中年表 · 希罗多德取王以铸译本 ·
日文人名用汉字写法 · 族名按实际读音译 · 闽南语取台罗 · 越南语不引 A/B/C ·
官话母语人口口径写死 · 大规模死亡人数一律并列区间

其中两条查下来不是体例问题,是错误:
- 序章梵语「父亲」原作词干 pitṛ́,而同组另外四门与重构式全是主格单数
  ——一组对照换了不止一个条件,正是自查清单第一条。已改 pitā́
- 第 18 章卢旺达「约八十万」不是任何一项研究的结论,是政府数 107 万、
  人权观察 50.7 万、近年研究五六十万之间的中点。已改为区间并写明分歧来源

另:第 18 章「阿马尔奈书信全部用阿卡德语」→「绝大多数,不是全部」
(EA 24 胡里语、EA 31/32 赫梯语,而第 13 章的线索正从后者起头)
第 17 章涅夫斯基之妻萬谷イソ → 万谷矶子(萬谷イソ)

欠账 636→645(86%);成书前 44→35

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
查出结果的几条:
- 第 33 章 Hansard 语料:Brown et al. 1993 原文 1,778,620 句对 / 28,850,104 法语词,
  三年前同一组人只有 4 万句——正文已补实数,那个跳跃本身就是论点
  (WebFetch 取该 PDF 得到 OCR 残文,改用读图逐页才拿到)
- 第 28 章参数数量:查出的不是数字,是「根本没有这份清单」,正文已据此加强
- 第 18 章卢旺达身份证:HRW 原句到手,1930 年代自报登记;关键是自报不是测量,
  这正好把「按十头牛划分」挡在外面
- 第 16 章陆法言「约 562 年生」已删:查不到提出者,疑从《切韵序》倒推,
  而倒推是 §17 明令禁止的
- 第 25 章埃兰-达罗毗荼:McAlpin 1981,反方理由亦取到
- 第 32 章托管文件第二十二条原文到手,并改对颁行主体(国联理事会,非英国托管当局)
- 第 18 章乍得语族改 150–190 门、卢旺达语改母语者 1500 万
- 第 7 章「特征文字全世界只有一套」加限定词,与第 9 章同强度

另 16 条属「该核的已核、剩下那截正文没主张」,销账并写明残留

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
方法:curl 拉 archive.org 的 _djvu.txt 全文到本地再 grep 定位。
此前各轮只用抓取工具直取网页,遇到原刊就卡住;而十九世纪的德文、
拉丁文原刊在 archive.org 上大多公有领域、可整本下载。

破掉的:
- 序章第一条(全书最老的一条):下到 Beiträge 第 5 卷,版面彻底查清——
  文章实占约一页半,而寓言的原始印欧语正文只有十二行。正文已改。
  并从原刊坐实标题作 Avis akvasas ka#),那个记号是施莱歇尔自己的脚注引标
- 第 1 章萨林贝内:名目是 superstitiones(正文原作「怪癖」偏轻,已改),
  同一处括注的 (350f.) 即 Holder-Egger 的 MGH SS XXXII 页码,一并解决另一条
- 第 11 章:查到的是反面——拉斯克在《德语语法》被点到约七十处,
  但 Vorrede 与辅音推移那一节都没有。正文原在订正区块里写「明确提到了先例」,
  分量太重而定位不到,已改为可查的「大量征引,约七十处」
- 第 14 章缪勒「重印十五次」查无出处,改为可查的版次序列
  (版次与印次是两回事,原句很可能混算)

边界也摸清:archive.org 借阅受限书取不到(《句法结构》三条路全封),
与前几位责编踩到的是同一堵墙

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
正文改进两处:
- 第 15 章补上 *cantare habeo 的晚期拉丁书证(奥古斯丁 petant aut non
  petant venire habet)。意义不止补出处:正文原先只给带星号的重构式,
  读者会以为整个说法都是推出来的;补上书证之后,星号标的就只是那个
  具体词形而不是这个格式本身——与序章讲星号分级那一段互相印证
- 第 16 章文白异读:zdic 路径已变,改走 Wiktionary 拿到词典级来源。
  「薄」全对;「色」的分工也对,但该条目把「掉色」注作 diàosè,
  两读并行,已把这个提醒记进条目

第 15 章 kuningas:词源坐实,年代无来源——而正文本来就没主张年代,
它作的是结构论证,「借得早」由形式本身给出

新墙:连续抓取后 archive.org 开始拒绝连接(HTTP 000),依赖它的条目
本轮做不下去。下次用这条路要节流。
另确认:archive.org 借阅受限书取不到(《句法结构》三条路全封)

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
- 第 15 章 *cantare habeo:找到晚期拉丁书证(奥古斯丁 petant aut non petant
  venire habet),正文已补——星号标的从此只是那个具体词形,不是这个格式本身
- 第 15 章 kuningas:词源坐实、年代无来源,而正文本就没主张年代
  (它作的是结构论证,「借得早」由形式本身给出)
- 第 16 章文白异读:zdic 路径已变,改走 Wiktionary 拿到词典级来源。
  「薄」全对;「色」的分工也对,但该条目把「掉色」注作 diàosè,两读并行
- 第 13 章奥斯特霍夫:脚注追到 de Mauro(索绪尔《教程》校注本编者)
- 第 13 章《论元音》的「二分」:三个角度都查过,确认是本书自己的史学判断
  而非可引的事实陈述——措辞保留,但把认识论地位记进条目

诊断更正:archive.org 断连不是它在限流,是本机代理到该站的路由坏了
(DNS 解析到 198.18.0.99,走 127.0.0.1:7897,TLS 握手失败)。
已挂后台探测等它恢复。

欠账 681→683(91%)

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
- 第 1 章伦敦语文学会:调到《会刊与会报索引,1842–1879》(Herrtage 1884),
  查出伦敦不但没有类似禁令,方向刚好相反——索引里语言起源的篇目一条接一条:
  1862–63「模仿说」、1867 基教授讲「汪汪说」、1873–74「拟声说」,
  最后一条还在传说中的 1872 年禁令之后。正文由「说法不一」改写成确定结论
- 第 7 章骑驴浮雕:调到 Gardiner–Peet–Černý《西奈铭文》卷二(1955)。
  人名 Khebded、铭文 112(阿门内姆赫特三世)、随从 Kekbi,
  连「一个孩子牵、一个孩子赶」都是原刊直接给的,已补进正文
- 第 7 章狮身人面像 Sinai 345:红砂岩、通长 237 mm、大英博物馆 41748;
  圣书体在右肩、原始西奈文字在基座左右两侧(原作「另一面」含糊,已改)。
  「半份双语」的分寸也定了:同器同神但两段并非互译,措辞与材料相称
- 第 5 章苏美尔词表:系列已定,哈图沙那一环有支持但拿不到学术级引文,
  路线写明(CTH 299–309 / MSL 博阿兹柯伊卷)

操作经验:archive.org/download/ 会间歇性 500,从元数据取 server+dir
拼直连地址就稳(ia601509.us.archive.org/8/items/...)

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
- 第 6 章乌鲁克/U-j 年代:补三个实数(U-j 涅伽达 IIIA2 约前 3300、
  乌鲁克三至四期前 3300–3100、碳十四把 IIIA2 推到前 34 世纪中叶,
  比通行历史年表早一百多年)。两个区间不但叠着,碳十四那头还偏向埃及
- 第 13 章索绪尔致梅耶信:坐实为 1894-01-04,Benveniste 刊于 CFS 21(1964)。
  正文由转述改为直引——原话「语言学里用的术语没有一个是我认为有任何意义的」
  比转述狠得多,而这正是他生前写不出那本书的当事人自述
- 第 23 章新几内亚生物名称:从无源之句变成实证。Kik et al. 2021, PNAS
  118(22): e2100096118——学生流利率 58% vs 父母 91%,下一代预测 26%;
  1313 名受访者只列出 117 种传统用途植物

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
核验查出一个真问题:人物谱里「阿特金森」是两个不同的人——
- Elizabeth Grace Atkinson(第 3 章,2018 年在《细胞》推翻 FOXP2 选择性清除)
- Quentin Atkinson(第 12/23 章,2003 年与格雷给印欧语系定年 8700 年)
第 12 章正文本来就写全名,其余七处是裸姓氏。已全书统一为
「伊丽莎白·阿特金森」与「昆廷·阿特金森」,两条互相注明。
这是本轮第四次同名撞车(前三次:霍尔/黑尔、罗斯、伯克/伯科)。

另修一处我自己造成的不一致:人物谱格林的速写还写着「注明是拉斯克
先看见的」,而第 11 章正文已因定位不到改成「大量征引拉斯克」。已同步。

核验结果(十项全通过):
  注释配对 35/35 · frontmatter words 与实测 35/35 一致 · 节数 35/35 合规
  跨章引用 517 处零错 · 姊妹书串味 0 · 落单裸星号 0 · 正文占位符 0
  人物谱 265 条零重名零空速写 · people 缺口 0 · 时间线时序通过
  旧口径「46 亿」残留 0

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
正文改动(均先核后改):
- ch4 伦理争议① 由「有人质疑」改为叙述者自陈——查不到出处就不借别人的口
- ch5 批评① 换口径:原「用结论去认前提」无出处,改为恩伦德 1993
  「除记数符号外筹码与符号的对应很少能证明」+奥弗曼 2018「筹码标签下得太松」
- ch17 819「字符」→「规范彝字」,并补 1165 这个字符口径(错误模式 3:口径混用)
- ch29 四条反例点名:老挝语/他加禄语·亚齐语·迪尔巴尔语/古典拉丁语·吉瓦尔利语/
  海峡萨利什语;补一句划掉蒙达里语的正是埃文斯自己

核验:
- Evans & Levinson 2009 全文取自马普 PuRe 开放仓库,四条反例逐条对到页码;
  正文原有的「若干条仍在争议中」与论文自述一致,属 A 型
- 规范彝文批准日期精确到 1980-08-01(中国民族报),文号仍缺
- 张梦翰 1987(复旦官网)、金力 1963、严实未见记载

人物谱 265 → 283 条:补入恩伦德、奥弗曼、严实、金力、本尼迪克特、马蒂索夫、
涅夫斯基、勒博尔涅、蒂斯、萨弗兰、约翰逊、迈克尔·科、米利塔列夫、波特曼、
潘迪特、里利、居尔德曼、本顿。其中十一位是正文点名而谱内无条目的真缺口
(违反规范 §19),旧检查只比对 frontmatter 的 people 字段,查不出来。

新增 tools/roster_check.py:直接扫正文里「中文名(拉丁原名)」式的正式引入,
对人物谱逐个查。现全书 0 缺口、0 重名、0 空速写。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
ch28(《句法结构》):
- 例句原形改正(B 型):「The man who said that … is here」→「is arriving today」,
  并给出乔姆斯基三条模板原样。出处:普勒姆 On the mathematical foundations of
  Syntactic Structures,第 3 页逐字引原文并附校勘注「[comma in original]」
- 补一层:该书这一段并没有给出证明,它说证明在 1956 年那篇文章里,
  而核对过那篇的人认为那里也没有——「这个论证的名声比它的原文硬」
- 刺激贫乏一节改掉一处口径错误(错误模式 3+7):原说「儿童接触的语料里频率
  比假定的高」,实际普勒姆数的是《华尔街日报》头五百个疑问句里至少五个关键类型;
  真正的儿童语料库(Legate & Yang)给的是「占全部疑问句不到百分之一」。
  现两个数各归其语料,并点明「两边说的是同一件事,脚下的尺不是同一把」
- 补普勒姆本人的声明:那篇文章没有主张天赋论是错的(据其幻灯片对罗伯茨转述的逐字订正)
- 结构依存首次出现处:两说并存已记明(Chomsky 1965 vs 1971/1975),正文本就不系年份

ch27:补 Gilbert et al. 2006 的右视野结果(PMC1326182)——跨界的便宜只出现在
右视野,加语言干扰就没了。列文森旋转实验判定与库克萨约雷语那段重复,不补。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
ch10:用浏览器做了 CBETA 交互式检索(此前 WebFetch 驱动不了这个 JS 应用)。
按作品起始年代升序排,「世界」最早出于 T0313《阿閦佛國經》,後漢支婁迦讖译,
CBETA 系年 147——比原记录的竺法護《正法華經》(286) 早 139 年;安世高
(148–170) 名下三部亦在用。原先「支婁迦讖能否再往前推」的悬案就此销掉。
两处打折已记明:CBETA 的年代是译者活动年代的通行系年而非纪年写本,
译者归属沿用历代经录。

ch5 库辛(B 型):原文写成「学界有两种读法……两种读法都有支持者」,
查下来根本不是两派之争——「人名说」和「说不准」出自同一页
(Nissen/Damerow/Englund 1993: 36),而 Renn 在马普开放获取那篇的脚注里
直接写「his name is a poetic license」。现改为:最原始的研究本身就说判断不了,
「人类第一个留下名字的人」是转述途中长出来的。人物谱同步改。
另排掉一条检索噪声:某次检索摘要称库辛与 sanga 头衔同现,回查维基原文无此二字。

ch32 本-耶胡达(B 型):原文「各家统计从一百多个到三百多个不等」,
「三百多」这个上界任何一家都没给出。希伯来语维基作「不超过 300」(无脚注),
希伯来语学院作「好几百」,分歧多半在算不算旧词赋新义。现按此重写。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
原文经 Wayback Machine 从已停站的 PapuaWeb 数字馆藏取得
(Melanesia: Beyond Diversity, ANU 1982, pp. 33–38)。通读全文后:

- 塞莱佩特语 bia→bunge 那个故事**不在这篇里**。正文原作「莱科克在 1982 年
  那篇文章里转述了麦克埃尔哈农记下的一件事」,已改为只说它由麦克埃尔哈农记下、
  此后被反复转述。更可能的出处是莱科克 1979 年那篇,本轮未取到核对。
- 乌伊赛方言的数字改正:欠账原记「约 1500 人」,原文作布因语约 17,000 人、
  乌伊赛方言约 1,000 人;反的是整套性别呼应(代词、动词呼应、数词、指示词、
  常用形容词,单双复三数),不是「名词的类别归属」。
- **最要紧的一处**:那个「有影响的人宣布从此不许说得跟别人一样」的机制,
  是莱科克自己的推测——原文写的是「I believe that…」。正文原先把证据弱点
  归在「当事人自述的动机」上,对这条并不成立,它连自述都没有。现改为
  「他给的是一个能解释现象的故事,不是一份证词」。
- 补进塞皮克那句第一手原话:「大家都说一样的话有什么好?我们喜欢知道人是
  从哪儿来的。」另两个第一手案例(Malol 的 Tainyapin、Yelogu 村)记在欠账里备用。

麦克埃尔哈农补入人物谱(正文点名而无条目)。roster_check.py 写明已知盲区:
不带拉丁原名括注的人名扫不出来——这一位就是手工发现的。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
ch14(B 型):原文「英属印度的教科书里出现了『雅利安人南下』的叙事」——
教科书的书名与年份始终查不到。现改用查得到的东西:特劳特曼
《Aryans and British India》(UC Press, 1997) 第 4 页命名并记录的
「印度文明的种族理论」,连同他那句「异常耐久,对新材料有抵抗力,一直活到今天」
和「印度史里的马唐草」。原文取自 archive.org 无借阅限制副本的 PDF 文本层
(该条目的 _djvu.txt 是用错文种模型 OCR 的乱码,须直读 PDF)。
特劳特曼入人物谱(1940–,Wikidata Q3530432)。

ch30(B 型,小):原文「同时代的会议记录**没有留下来**」是一句证实不了的
负面断言,改为「同时代的记录**本书没能找到**」——只担保本书查过什么。
另补进一条查实的书目事实:《手语结构》1960 年初版是布法罗大学
《语言学研究》丛刊第八号临时论文集(据 1978 年修订本版权页)。

ch4 Ethnologue:结清。正文本就没写死数字,其定性说法与全部公开口径核过无冲突;
第 29 版进不去只挡住「把数字写死」这个可选动作,属编辑取舍而非核验缺口。

全书核验通过:欠账 718 清/待核 0/成书前 31;注释配对 35/35;
frontmatter words 35/35 精确一致;交叉引用 550 处 0 错;裸星号 0;
正文占位符 0;退役口径「46 亿」正文 0(提纲里两处是订正说明);
人物谱 285 条,0 重名、0 空速写、0 覆盖缺口;语系谱 155 条全部销账;
时间线 130 行按年顺序正确。全书 35 篇 234,156 字。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
新增 §〇(当前状态)、§三之二(浏览器驱动 JS 应用/Wayback CDX 列目录/
archive.org 坏 OCR 时改读 PDF 文本层/Wikidata API 取生卒年并数来源/
马普 PuRe 检索接口)、§三之三(检索摘要会凭空长出内容;证实不了的负面断言)、
§七之三(留给下一位的三类事)。

并订正两处过时记载:语言史/ 已纳入 git;§七之二第 3 条已办。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
写作规范新增 §36(全书人口与语言数的统一口径,五条):基准版本 Ethnologue 29;
默认给母语者数且不得与含二语的数并排比;精度不超过来源;语系语言数一律带「约」
并接受各家不一致;定稿按同一版本统一重取并写明快照日期。**八条欠账挂的是同一件
事,口径定了,剩下的只是定稿取数。**

正文改动(每一处都先核后改):
- ch8 补入印度河文字「是否算文字」那一路质疑(2004 年)——主控裁定放第 8 章,
  因为该章已写了「平均只有五个符号」,而那正是这路质疑的核心证据;更要紧的是
  那份「还没读出来的」名单每条都默认「有东西可读」,印度河争的就是这个默认
- ch14 + ch19 匈牙利那句一并改写:原作「基因构成与周边邻居接近」查下来两章都
  没出处,现取 Maróti et al. 2022(Current Biology 32:2858–2870,CC BY-NC-ND,
  从匈牙利科学院仓库取得全文)——「immigrants were in minority compared with
  the locals of the Carpathian Basin in each period」。**论文说的是征服当时的构成,
  比「一千年后的结果」对本书的论点更硬**:带语言来的人从头就是少数
- ch19 补罗贝茨那个年代的可信区间:点估计 9181 BP,95% HPD 是 5595–12793——
  宽七千二百年。原议的「与考古年代的落差」查下来不存在(考古侧作 9000 BP)
- ch19 尼夫赫语「孤立语言」改掉:第 25 章明写「严格讲不对」,两章打架,以 25 章为准
- ch20 壮侗语系「约九十门」→「九十多门」(Ethnologue 95,按 §36③)

提纲:时间线补 1190/1909/1937-11-24/1942/1972/2004 六行并逐节校序(第一次插入
有四行落错节,已移正),莱科克 1982 篇名据原刊订正;人物谱范德里姆 ? → 1957–。

跨章口径核对:尤卡吉尔/尼夫赫/凯特/楚科奇-堪察加在 ch19、ch25、语系谱三处全部一致。
通古斯「不到十万」与锡伯「三万左右」相容,裁定不改。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
正文改动(先核后改):
- ch3 七人生年回填(Wikidata 两跳,逐条数 references):戈普尼克 1935、
  瓦尔加-哈德姆 1949、埃纳德 1970、沃克 1951、纽波特 1947、莫纳科 1959
  (**该条 Wikidata 无来源,只取到年不取月日并写明证据强度弱于其余五人**);
  伊丽莎白·阿特金森两式检索无匹配 → 未见记载
- ch4 伦理争议第二条:撤掉「来自聋人社群自己」这个坐实不了的归属,改为直接给出
  支撑它的两份研究(Polich 2005 九年田野;Goldin-Meadow, Human Development 53(5))。
  **正文现在给的是证据,不是立场归属。** 两位入人物谱
- ch28「生成语法成了世界上最大的一个语言学流派」→「影响最大的流派之一」,
  并把不写「最大」的理由与塞尔那句「以最初宣言所述的目标衡量,这场革命并未成功」
  写进正文。塞尔入人物谱(1932-07-31–2025-09-17)
- ch32 希伯来语含二语数「约一千万」→「超过一千万」(源数 10.6M,按 §36③ 不下吞)
- 终章「一万年后会数出几百门」补一句:这个量级是本书自己推的,不是文献数

裁定(不改正文,理由写进欠账):ch13 库里洛维奇维持泛指;ch27 希姆巴不扩写;
ch20 汉越音六字表不需要「单一出处」——它是可自己推一遍的推导,不是引文。
ch27《Hopi Time》677 页坐实(OpenLibrary,ISBN 9027933499);
ch22 本内德补齐(Marvin Lionel Bender, 1934-08-18–2008-02-19;条目名是
「Lionel Bender」,此前查不到多半卡在名字形式上)。

两个工具 bug:
1. refresh_readme.py 的正则 `[\d\s]+` 不含逗号,配不上目标数「240,000」,
   于是「当前正文字数」那一行十轮以来一直没被刷新过,停在 10,008。已修并加断言
2. build_html.py 自己写了一套 wc(),没去 Markdown 记号——用的是 2026-08-01
   已废弃的旧口径,与 README 差 11,148 字(234,920 对 223,772),而这个差额
   恰好就是 measure.py 开头记的那笔「全书合计近一万字」。已改为共用
   measure.count_text,并把字数移到去章标题之前算,两处现在都是 223,772

README 待办整段重写(原文说「十六篇低于 4500 字下限」,实际 0 篇低于、18 篇高于)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
用应用内浏览器直取 ethnologue.com 与 glottolog.org——curl/WebFetch 一律 403,
真浏览器可通。这是本轮打通的新路线,最后 13 条「成书前」全部据此销账。

一手取得的数据:
- ethnologue.com「7,170 languages are in use today」(此前只有维基转述)
- 家族浏览页各语系语言数(免费层)
- Ethnologue 200(2026 版)前 200 名单,L1+L2 总数
- Glottolog 5.3 走 DataTables 服务端接口:Top-level family 246、Isolate 183

改正的数字(每处都先核后改):
- 汉藏语系 约450 → 463 门
- 亚非语系 约380 → 391 门
- 印欧语系 约446 → 456 门
- 爪哇语 约8000万 → 母语者不到七千万
  (原数高于 Ethnologue 的总使用者数 69.2M,按哪个口径都偏高)
- 濒危比例 43% → 44%
- 孤立语言 184 → 183(写作规范里挂了一轮的「尚未对 5.3 复核」,现已复核)

查出并修掉一处 §36① 违规:序章把 7,170(Ethnologue)与「两百四十多个语系/
一百八十多门孤立语言」(Glottolog)并排,两个数据库混用而未注明。书里原记的
数字完全正确,缺的只是出处——现已写明两个数据库的分工,并写进 §23 口径表。

诚实的边界:单语言的母语者数确在订阅墙后($480/年),免费的 Ethnologue 200
只给 L1+L2 总数,按 §36② 不能与本书的母语者数并排比。本轮只把它当上界用,
书里每一处母语者数都通过了上界检验。这一条写进了各章欠账,没有含糊过去。

其余销账:姊妹书《要有光》已定稿,第 33 章的章号回填为第 11、17、22 章;
终章第四节复审,「现在没有人想得出来」改为「眼下还没有人给出过答案」——
把关于全人类认知的断言换成关于文献现状的可核陈述。

749/749(100%)· 待核 0 · 成书前 0
核验:注释配对 35/35 · frontmatter 字数 35/35 · 跨章引用 551 处 0 越界 ·
占位符 0 · 人物谱 288 条 0 重名 0 空速写 · 语系覆盖全部销账 · 时间线顺序正确

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title 《星号之下——语言史话》全书 35 篇 + 欠账清到 736/749 《星号之下——语言史话》全书 35 篇 · 欠账清零 749/749 Aug 4, 2026
CI 一个都没跑,根因不是 workflow 配置:ci.yml 的触发是无过滤的
pull_request,本该跑。是 PR 有冲突 → GitHub 造不出 refs/pull/230/merge
→ pull_request 事件的工作流直接不触发。冲突解掉,CI 自然会跑。

冲突从何而来:main 在 8 月 3 日由 4c179af 直接提交过一版 语言史/(约 21
万字、391 条欠账一条未清的初稿),而本分支从它之前的 a717dd3 分叉,两边
各建了一次同名目录,于是 49 个文件全是 add/add。

解法与依据:
- 语言史/ 全部取本分支版本。已核实本分支是严格超集——main 的 58 个文件
  一个不缺,另多出 refresh_words.py 与 roster_check.py 两个工具;且 main
  上 语言史/ 自 4c179af 入库后再没有任何提交,取本分支不丢任何东西。
  内容对比:main 那版 391 条欠账全部待核,本分支 749 条全清。
- .gitignore 取 main 版。它是超集——覆盖两本书 × 三种格式(要有光/星号之下
  的 全书.html、试读本.html、试读本.pdf),本分支只加了一行。

顺带修掉 README 里没跟上的欠账数(还写着 736/98%/成书前 13),
改为 749/100%/0,并补上末轮打通 Ethnologue 的经过与订阅墙那条边界。

合并后复核:749/749 · 35 篇 223,993 字 · 注释配对 35/35 ·
人物谱 288 条 0 重名 0 空速写 · 全库 0 处残留冲突标记

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
@oratis oratis changed the title 《星号之下——语言史话》全书 35 篇 · 欠账清零 749/749 《星号之下——语言史话》欠账清零 749/749(承接 main 上 8-03 那版初稿) Aug 5, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant