釋字及憲法法庭資料庫

釋憲及憲法法庭資料庫 架構書與使用指南

870 件釋憲文本(釋字 813 + 憲判 57)的多層結構化資料庫:完整架構、標註流程、使用方法與後續方向

本文件所有數字均由程式自資料檔重算產出(2026-08-11)。供公法實證研究者、實務工作者與學術研究使用。

目次
第一部 意見書標註的重新設計(v4 架構)
第二部 資料庫完整架構(圖與文)
第三部 使用指南:這個資料庫能回答什麼問題
第四部 後續建議方向
先說最重要的一件事:意見書實質標註(v1–v3)已全部隔離。 1,514 篇意見書的實質內容標註(分歧點、論理依據、權威來源、制度角色主張等)經三位獨立標註者 盲測,六個欄位的編碼者間信度全部未達 κ .70 門檻。這批資料不精確,拿去研究會誤導, 因此整批移入隔離區,不列入本資料庫的可用資料。本文件第一部說明重新設計後的標註架構; 在 v4 依新架構完成並通過信度驗收之前,意見書層只提供「全文語料」與「標題結盟網」兩項可靠資料。

第一部意見書標註的重新設計(v4 架構)

1.1 為什麼 v1–v3 失敗:數據診斷

失敗不是因為讀得不夠仔細——三位盲測標註者的實讀比例達 75% 到 91%,κ 仍然不及格。 把 49 個碼按性質分成兩堆之後,病灶就清楚了:

碼的性質定義碼數平均 κ中位 κ
抽取型文本中有可指認的具體對象或明示行為(引了哪國法、哪則解釋、明示應不受理)140.6810.703
詮釋型需標註者刻畫論證性質(這算理由分歧還是補充、這算方法論批評嗎)350.4630.443

而且抽取型裡表現差的兩個碼(L1 憲法條文 .392、A10 國內其他法令 .244),敗因都不是「認不出來」, 而是收錄範圍沒定義——同一則被引三次記幾筆、註腳清單要不要展開,碼表從沒寫。 結論:問題出在把「抽取」和「詮釋」混進同一份工具,以及計數單位缺席;不是標註者、也不是閱讀深度。

1.2 v4 的四條設計原則

  1. 判準以文本中的行為/位置描述為斷。標註者只回答「你指得出來嗎、指到多精確」, 不回答「這算什麼」。這條原則在本專案已成功兩次(五層標註的證據句鐵律、立場表的逐字重壓平驗證)。
  2. 全文精讀,無摘讀。每篇附閱讀紀錄,逐節推進,實讀 100%。
  3. 分類與抽取分離。標註者逐字抽取原文(論據名稱、來源、機關、動作); 分類碼由程式依「對照表」事後施加。分類錯了改對照表重跑即可,不必重標 1,514 篇, 而且對照表本身成為可爭論、可修訂、版本化的研究對象。
  4. κ 是放行條件,不是事後報告。v1–v3 最大的程序錯誤是把信度測量放在全量之後。 v4 在 pilot 階段即雙盲標並算 κ,任一欄 < .70 就修碼表換種子重測,不進全量

1.3 編碼單位:意見書自己的分節

v1–v3 以整篇為單位,一篇一萬字壓成一組碼,標註者在心裡做大量無法追溯的聚合。 v4 改以意見書自己的分節(壹、貳、參…;57 篇自帶段號者用段號)為單位, 每節只問「這一節在做什麼」,篇層輪廓由程式彙總。單位由文本決定,不由分析者決定。

1.4 欄位設計:全部是抽取

v4 欄位總表——右欄是每一欄的機器驗證方式,這是 v4 與 v1–v3 最大的差別
欄位標註者做什麼程式驗證
定位強度
P1–P4
本節批評多數意見時,指出對象到多精確:P1 逐字引出被批評文字/P2 明示理由段號/P3 明示主文項次或系爭規定/P4 僅泛稱「多數意見」P1 回比判決本文須為連續子字串;P2、P3 驗證該段、該項確實存在。實測可行性:52% 的意見書有指涉多數意見的引號引文(其中 42% 可逐字對回本文)、43% 明示段號
被批評命題原文逐字抽出(P1–P3 必填)程式切片回比
分歧宣示句本節宣示不同意的那句話,逐字程式切片回比意見書原文
結論方向僅二值:主張合憲而多數違憲/主張違憲而多數合憲/無結論爭執(明示語為斷)v3 盲測中結論分歧 D1 的 κ = .816,證實此判斷可靠
論據名稱原文[]逐字記(「比例原則」「代理難題」「憲法第23條」),不分類切片回比;L 碼由程式對照表施加
來源原文[]逐字記+出現位置(正文句中/句末括號/註腳/附表)切片回比;A 碼由程式施加。計數單位寫死:每出現一次一筆、註腳清單逐則展開、附表一筆註明 N 則
機關指涉[]機關原文+動作原文(「應由立法者決定」「本庭應尊重」),逐字切片回比;自制/積極/分工由程式自機關+動作推導
廢除 使用方式(U)欄。盲測證實該欄兩輪只有 16% 的來源能配對、 配得上的部分 κ 僅 .463,且判準在文義上是封閉決策樹、「無從判斷」不可達。 v4 改記可觀察的出現位置;「這個引用算支持還是對照」的解讀權留給研究者。

1.5 品質管線與放行條件

  1. 證據句全部程式切片+回比(去空白連續子字串、多片段前推式順序遞增)。
  2. 凡取數字回有換行的原始檔核對——全庫已知 91 處頁碼夾在「第 N」與單位之間,去空白後會生出原文不存在的條號。
  3. 相容漢字(56 篇含 U+F900–FAFF):NFKC 正規化定位、一律自原文切片。
  4. pilot 40 篇 × 2 位互盲標註 → 逐欄 κ ≥ .70 才放行全量;未達即修碼表、換新種子重測。
  5. 全量分批精讀(每批 ≤ 20 篇),批間抽查前批 5 篇,判準漂移即停。
  6. 完成後另抽 10% 交第二標註者盲測,逐欄報 κ;未達標之欄位隔離,不入交付集。

規模估算:1,514 篇全文精讀(平均 8,420 字/篇,最長 56,400 字),約 76 批。 與 v3 全量同量級偏上。是否啟動由研究者決定;啟動的前提是 pilot κ 達標,這一關不過就不花全量的成本。

第二部資料庫完整架構(圖與文)

2.1 六層架構總覽

整個資料庫是一條「原始文本 → 可驗證標註 → 研究可用資料」的生產線,分六層。 每一層只依賴上一層,且每一層都有自己的驗證。下圖是全貌:

L0 原始層 憲法法庭官網 870 件判決頁(含附件 OCR 內嵌文字) cons.judicial.gov.tw 本地封存 44 件 HTML 快照+18 件意見書 PDF 90_原始存檔/ 結構化抓取檔 資料庫.json(65.7 MB,870 件全欄) _pipeline/ L1 語料層(標註者唯一閱讀範圍) 卡片 870 張 4,798,585 字,固定區塊順序 =標註與驗證的共同基準 60_全文抽取/卡片/ 意見書全文 1,514 篇 12,748,184 字(另 19 篇無文字層) 57 篇自帶段號 60_全文抽取/意見書全文/全文/ 立場表原文 57 件 doc_att_txt 之 OCR 壓平文字 60_全文抽取/立場表/原文/ L2 標註層(六個資料集,各有碼表與驗證) ① 五層全文抽取 碼表 v2.7|870 件|證據句 34,739 回比 0 失敗|A程序 B實體 C引用 D文件 E人物 ② 主文立場表 碼表 v3|57 件 227 項次 3,140 格位 對帳 90.7%|格位確定 97.6% ③ 大法官任期表 碼表 v2|127 人 132 段 已查證 78・部分 10・待查 44 ④ 意見書結盟網(標題層) 碼表 v2|1,533 篇 526 次關係 可解析 99.8%|案件覆蓋 37.5% ⑤ 聲請人歸屬 306 筆裁判|101 件有字號 D 碼/S 碼|769 件無字號(排除記錄) ⑥ 案件歷程 392 件歷程|確定終局裁判 1,075 筆 法官參與 686|合議庭共事 660 ⚠ 隔離區:意見書實質 v1–v3 1,514 篇標註|六欄 κ 全未達 .70 不入交付集、不入統計、不供檢索 僅保存供方法檢討;v4 通過 κ 驗收後取代 L3–L5 產出層 L3 併檔(長表 CSV) 案件層 870|結論 1,841 引用邊 2,071|席次 12,461 立場表長表 3,140…共 18 檔 L4 彙總(dash.js) 全部圖表數字之單一來源 前端不含任何手打數字 L5 呈現(網站) index.html 10 個分頁 靜態站,可直接開啟或 GitHub Pages 託管 下載交付 JSON(逐件)+CSV(長表) 附五份碼表與驗證程式 v4 通過 κ 驗收後,以新資料集取代隔離區 意見書語料(可靠) 供 v4 標註與全文檢索
圖一 六層架構。綠框=通過驗證的可用資料集;橘框=隔離區。箭頭為資料流向;虛線為規劃中路徑。

2.2 六個資料集的標註流程、數量與結果

每個資料集都走同一條紀律:成文碼表 → 標註(附逐字證據)→ 程式驗證 → 多批次獨立佐證才修碼表 → 修訂後全量回填。下表是各資料集的完整帳目:

資料集碼表
版本
編碼單位規模標註流程驗證結果
① 五層全文抽取
可用
v2.7
(7 次修訂)
一件一物件
(A 程序/B 實體/C 引用/D 文件/E 人物)
870 件
結論 1,841
引用 9,008
席次 12,461
建卡片(固定區塊)→ 分批標註 → 每次碼表修訂全量回填(v2.1→v2.7 共 7 輪,每輪觸發皆為多批次獨立佐證) 證據句 34,739 條,子字串與順序回比 0 失敗;R 碼歧異 9 件經盲測仲裁;發現並更正 2 件署名列建庫錯誤
② 主文立場表
可用
v3
(2 次修訂)
主文項次 × 大法官
(一格一票)
57 件
227 項次
3,140 格位
OCR 壓平表格 → 三個解碼關鍵(席次遞增/「無」定欄寬/版面模型)→ 程式窮舉切法、重壓平須與原文逐字相同 → 憲訴法 §30 門檻僅供排除 項次對帳 90.7%(206/227);格位確定 97.6%(3,064/3,140);76 格未定係 PDF 壓平時資訊永久滅失,非標註不足
③ 大法官任期表
可用
v2
(1 次修訂)
一段任期一列 127 人
132 段
兩路並行互不填補:程式自 870 件署名列推導觀測窗|WebSearch 逐人查官方任期(逐筆附出處網址)→ 合併比對一致性 已查證 78 段、部分 10、待查 44(屆次全數查明);任期窗檢查抓出 2 件建庫錯誤;「評議在任期內、公布在卸職後」一例經核實為口徑差異
④ 意見書結盟網
可用
v2
(1 次修訂)
一篇一列+
一關係一列
1,533 篇
526 次關係
239 組配對
卡片意見書清單 1,680 條目 → NFC 正規化 → 五層樣態分類 → 共同提出/加入/部分加入分列建網 可解析 99.8%(去重後);姓名逸出封閉集合 0 筆;案件覆蓋率僅 37.5%(326/870 件有清單,其餘無法區辨是無意見書或未上傳)
⑤ 聲請人歸屬
可用
(覆蓋有限)
聲請人歸屬
碼表
一筆確定終局裁判
一列
306 筆
(101 件)
pilot 32 筆 → v2 修訂 → 全量 306 筆;D 碼(裁判可否個別歸屬)+ S 碼(聲請人類型) 樣本流程完整記錄:870 件中僅 101 件官網載有確定終局裁判字號,769 件排除並記錄——此覆蓋限制必須隨資料引用
⑥ 案件歷程
可用
釋憲結果
碼表
一件一歷程 392 件歷程
1,075 筆裁判
官網案件歷程串接 → 法官參與 686 筆、合議庭共事 660 組、辯護型態 86 筆 與釋憲結果舊表對照 271 件;R 碼歧異 9 件已由盲測+v2.7 仲裁完畢
意見書實質
隔離
v3
(信度未達標)
一篇一物件 1,514 篇
(標註 37,212 筆)
v1 pilot 40 → v2 重讀 → v3 全量 59 批 → 151 篇三人盲測 六欄 κ:分歧點 .611/權威來源 .589/標的 .587/論理依據 .456/補充點 .430/制度角色 .391——全部未達 .70。整批隔離,不供使用;重新設計見第一部
可靠與不可靠的界線畫在哪裡。本資料庫的可用性判準只有一條: 該欄位的判斷是否可被獨立重現。①②③④⑥ 的核心欄位都有機器可驗的證據(逐字子字串、逐字重壓平、 出處網址、封閉集合比對);⑤ 可靠但覆蓋率必須隨引;意見書實質層因人際信度不足而整批隔離。 網站與交付檔中,隔離資料不出現在任何統計或檢索介面。

2.3 資料模型與鍵

案件(870) PK 案號 "釋字0813"/"憲判113-08" 類型・公布日・案由・客體型態 全案R碼・全案J碼・碼表版本 成果/*.json+案件層.csv 結論(1,841) FK 案號+系爭規定+客體種類 R碼(法規範)/J碼(個案裁判) 逐系爭規定結論.csv 引用邊(2,071) FK 引用者案號 → 被引案號 關係(援引/區辨/變更…)・出處=本庭論理 引用網絡_邊表.csv 參與席次(12,461) FK 案號+FK 姓名・是否主席 參與大法官.csv(NFC 正規化後 127 人) 大法官(127) PK 姓名(NFC)・姓名異寫[] ↓ 1:N 任期段(132):官方起迄+出處 任期表.json/.csv 立場表格位(3,140) FK 案號+項次序+FK 姓名 立場(同意/不同意/部分/未定)・對帳 立場表_項次大法官長表.csv 僅憲判 57 件 意見書(1,533) PK 案號+序・類型 O1–O5 提出者[]・加入者[](→關係 526) 意見書表.json+關係表.csv;全文 1,514 篇 (實質標註隔離中,未入模型) 確定終局裁判(1,075) FK 案號+裁判字號・D碼/S碼(306 筆) 確定終局裁判.csv+聲請人歸屬(101 件) 案件歷程(392) FK 案號・繫屬→受理→言詞辯論→公布 案件歷程.csv・法官參與 686 N:1 N:1 N:1 N:1 N:1 N:1→姓名 N:1 N:1 1:1 1:N 席次
圖二 資料模型。兩個主鍵實體:案件(案號)與大法官(NFC 正規化姓名)。所有表以此二鍵串接;姓名須落在該案參與名單(封閉集合)內是全庫通用的完整性約束。

2.4 後端與前端

現況說明
儲存檔案式(JSON 逐件+CSV 長表)無資料庫伺服器依賴;全部資料可 git 版本控制,每個數字可 diff 溯源。總量約 130 MB
後端靜態站(無伺服器)dash.js 為預先彙總的單一數字來源;前端載入時即時計算圖表,不含手打數字。研究者要跑統計直接讀 CSV/JSON,不經過任何 API 轉譯
前端index.html 十個分頁總覽/研究儀表板/主文立場表/任期與結盟/意見書實質(隔離公告與信度報告)/標註方法/流程圖/成果瀏覽(870 件逐件五層檢視+全文檢索)/缺口與爭點/檔案與重現
部署GitHub Pages 可直接託管亦可離線開啟。規劃網址 hssai-tcc.phys.nthu.edu.tw(先前已議定 tcc 系列命名)
驗證管線隨庫附驗證程式證據句全量回比、立場表對帳重算、任期窗相容性、封閉集合檢查——任何人可重跑,重現所有「0 失敗」的宣稱
治理碼表版本化五份碼表全文公開,每次修訂記載觸發事由與獨立佐證批次數;修訂後全量回填,不留新舊口徑並存

第三部使用指南:這個資料庫能回答什麼問題

3.1 這是什麼(一段話)

它把 1949 年以來全部 870 件大法官解釋與憲法法庭判決,從「一篇一篇的文章」變成「一格一格可以查詢、 可以計算、可以驗證的資料」。過去要回答「大法官用嚴格審查的案件有多少」得把幾百號解釋讀一遍; 現在是一個查詢的事。而且每一格資料都附了判決原文的逐字證據,你不必信任標註者——可以逐筆核對。

3.2 怎麼開始用

  1. 只是想查、想看:打開 index.html(免安裝、可離線)。「成果瀏覽」分頁可以按案號、案由、 客體型態、結果碼篩選 870 件,點進任何一件看五層標註與逐字證據。
  2. 想跑統計:直接讀 data/併檔/ 的 CSV(Excel、R、Python、SPSS 都能開)。 一列就是一個分析單位:一件案、一個結論、一條引用、一格投票。
  3. 想驗證我們有沒有標錯:每筆資料附「證據句」欄,是判決原文的逐字片段; 「檔案與重現」分頁有驗證程式,可重跑全部檢查。

3.3 它能回答的問題(附實際數字)

Q 違憲宣告的比例隨年代怎麼變?
用案件層的 R 碼+年代。注意資料庫會先要求你依「客體型態」分流——870 件裡只有 602 件是合憲性審查, 統一解釋、憲法疑義解釋的「結果」跟合憲違憲不是同一件事,混著算數字沒有意義。儀表板已內建分流後的年代趨勢圖。
Q 哪些解釋最常被後案引用?引用是支持還是區辨?
引用網 2,071 條邊,只取「本庭論理」出處(聲請人主張的引用已分開,不會灌水)。 每條邊帶關係碼:援引 1,924、補充 42、區辨 25、變更 14……被引最多的是釋字第 371 號(53 次)。
Q 憲法法庭時期,哪位大法官投下最多不同意票?
立場表 3,140 格投票,97.6% 立場確定。可算每位大法官的同意率、不同意率、部分同意分布—— 但描述用,不宜直接讀成「異議傾向」,因為各人在任期間的案件組成不同。76 格因 PDF 壓平無法還原者,逐格列明候選讀法。
Q 誰常加入誰的意見書?有沒有穩定的結盟?
結盟網 526 次關係、239 組配對,共同提出/全篇加入/部分加入分開計。 最強配對如張瓊文→蔡宗珍 16 次。注意覆蓋率:僅 37.5% 的案件官網有意見書清單,早期釋字大量缺漏。
Q 某位大法官任期內參與了哪些案?跟誰同庭最久?
任期表 127 人 132 段(官方任期逐筆附出處)+參與席次 12,461 筆。 做「同庭共事」分析務必用官方任期而非觀測窗,否則卸職端會多算數月——資料庫已寫明這條口徑。
Q 意見書全文裡「比例原則」出現在哪些篇?
1,514 篇全文語料(1,275 萬字)可全文檢索。但語料檢索是「找到文本」,不是「回答統計」—— 意見書的實質分類標註目前隔離中(見 3.4),統計層面的意見書問題請等 v4。
Q 聲請人是誰?人民聲請和機關聲請的結果有差嗎?
A 層有聲請人類型(S 碼)870 件全有;確定終局裁判層另有 306 筆裁判的細部歸屬—— 但後者只覆蓋 101 件(官網有載字號者),用時必須交代這個限制。

3.4 它「不能」回答的問題(誠實清單)

3.5 引用時的三個規矩

  1. 引用任何數字時註明碼表版本(如「R 碼依碼表 v2.7」),因為口徑隨版本演進。
  2. 用到聲請人歸屬(101/870)、意見書結盟(326/870)這類部分覆蓋的資料,覆蓋率必須隨引。
  3. 對任何一筆有疑義的標註,先看它的證據句與疑義欄——那裡記載了判斷依據和已知的不確定。

第四部後續建議方向

4.1 立即可做(不需新標註)

事項內容成本
高信度意見書欄位獨立成集把盲測通過的八個判斷(結論分歧 κ.816、外國法 .799、受理爭執 .760、本院前解釋 .703 等)單獨抽出、標明信度發布。光「意見書層次的外國法引用 1,664 筆」就足以支撐一個比較法實證研究
意見書引用網 vs 多數意見引用網對照A1(本院前解釋,κ.703)5,302 筆對上既有的 2,071 條多數意見引用邊:意見書引的和多數意見引的是不是同一批解釋?異議者是否引不同的先例傳統?
網站上線GitHub Pages+議定網址;加 DOI(Zenodo)使資料集可被正式引用

4.2 高價值的資料擴充(需要抓取,不需要詮釋)

事項內容為什麼值得
附件全量補收言詞辯論筆錄、鑑定意見書、法庭之友意見書的 OCR 文字都已內嵌在官網頁面(四件封存憲判即有 242 個附件,現只收 16 篇大法官意見書),改寫附件篩選規則即可收齊這是目前最大的未開採資料;法庭之友與專家意見是憲訴法時代全新的研究題目
任期表 44 段補查總統府公報、司法院年鑑逐人查證早期大法官就卸職日補上後,1948–2003 的合議庭組成分析才完整
聲請人層擴充769 件無確定終局裁判字號者,經司法院裁判書系統回溯比對「誰的聲請成功」是實務工作者最常問的問題,現覆蓋率僅 12%
新案自動更新管線憲法法庭持續產出新判決;建立「新案→建卡→標註→驗證→上網」的例行流程資料庫不更新就會過期;憲判案件量還在成長

4.3 意見書 v4(本文件第一部的實施)

順序是硬的:碼表 v4 定稿 → 40 篇雙盲 pilot → 逐欄 κ ≥ .70 → 才進全量精讀。 κ 不過就修碼表重測,全量成本一毛不花。通過後以 v4 資料集取代隔離區, 屆時「意見書講了什麼」才第一次成為可以放心引用的統計對象。

4.4 跨資料庫串接(中期)

優先順序的建議。如果只做三件事:①附件全量補收(資料紅利最大、無詮釋風險)、 ②高信度意見書欄位獨立發布+意見書引用網(現有資產直接變現)、③意見書 v4 的 40 篇雙盲 pilot (花小錢回答「這條路通不通」)。三件都不必等彼此,可以並行。