意見書實質標註 v4 pilot 成果
40 篇意見書、程式預切 172 節,由兩位不同模型的標註者各自盲標
這批資料通過了驗收,可以看。
與先前隔離的 v1–v3 不同,v4 的每一筆都是「從原文抄出來的」而非「標註者判斷出來的」:
定位強度 κ = 0.811、有無分歧 κ = 0.930、來源嚴格配對率 80.6%,
9,116 個證據句片段獨立重驗 0 失敗。詳細比較見下表。
驗收結果
v3 vs v4:同型指標的對照
兩者用的是同一批語料、同樣的雙盲設計,差別只在「標註者被要求做什麼」。 v3 要標註者判斷「這算什麼」,v4 只要求「指出來、抄下來」:
來源可配對率從 16% 到 80.6%,是這次改版最關鍵的一個數字。
v3 時兩位標註者抽出的來源集合幾乎對不上——κ 還沒輪到分類判斷,就先被「什麼算一筆」的差異吃光了。
v4 把計數單位寫死(每出現一次記一筆、註腳清單逐則展開、附表一筆註明則數),問題就消失了。
兩位標註者實際標出了什麼
定位強度分布
P1 逐字引出被批評的判決文字(可回比判決本文)/P2 明示理由段號/P3 明示主文項次或系爭規定/P4 僅泛稱「多數意見」
結論方向分布
僅在有分歧的節上判斷,三值。
來源出現位置
正文/括號/註腳/附表,這是 v4 取代 v3「使用方式」欄的可觀察代理。
抽取總量
兩位標註者各自的筆數;差異本身就是配對率的分母。
雙標一致性
172 節逐節對照兩位標註者(不同模型)的判斷
定位強度混淆矩陣
列=標註者 F,欄=標註者 O。0=該節無分歧。對角線是一致的格。
逐節對照
來源與概念彙總
v4 的抽取結果——分類由對照表事後施加,這裡呈現的是未分類的原始抽取
最常出現的來源(前 40)
逐字原文,未正規化。同一則的不同寫法會各自成列——這正是對照表要收斂的對象。
最常出現的規範概念(前 40)
同節同概念只記一筆,故此為「在多少節出現」。
機關指涉(前 25)
只認明示語;自制/積極由對照表自機關+動作推導。
對照表要做多少事
相異值 vs 總筆數。相異值越少代表寫法越集中、對照表越好寫。
這份資料怎麼讀
給公法實證研究者與實務工作者
v4 標註者只做兩件事
從原文逐字抄出一段文字,或指出一個位置。凡是需要回答「這算不算 X」「這屬於哪一類」的判斷, 一律不由標註者做——分類由版本化的對照表事後程式施加,標註者連對照表都不准看。
這樣設計有三個好處:標註者的工作變成可機器驗證的抽取;分類錯了改對照表重跑,不必重標; 而且分類體系本身變成可爭論、可修訂的研究對象,不會被鎖死在資料裡。
四個欄位分別是什麼
| 欄位 | 抓的是 | 研究上可以怎麼用 |
|---|---|---|
| 分歧定位 | 本節每一處對多數意見表達不同意的地方,以及「指得多精確」(P1–P4) | 定位強度本身就是變項:哪些大法官會逐字引多數意見來反駁,哪些只泛稱「多數意見」。P1 的被批評文字可回比判決本文,能精確接到多數意見的哪一句 |
| 來源出現 | 意見書提到的任何外部文本或權威,凡出現即記,含出現位置 | 引用網絡、比較法引用趨勢、註腳密度。出現位置取代了 v3 失敗的「使用方式」欄——「這算支持還是對照」的解讀權留給研究者 |
| 規範概念 | 使用到的規範概念名詞,逐字,同節只記一筆 | 概念的擴散與消長(某個原則何時開始被援用);對照表可把不同寫法收斂成同一概念 |
| 機關指涉 | 對「誰應該做什麼」的明示主張,機關+動作皆逐字 | 司法與其他憲法機關的權限主張。自制/積極由對照表推導,不由標註者判斷 |
使用時的注意事項
- 這是 pilot,只有 40 篇。全量 1,514 篇尚未放行。任何分布數字都只反映這 40 篇,不可外推。
- 兩位標註者的結果都保留,沒有合併成一份。研究上要用哪一份,或要用兩份的交集(更保守)、 聯集(更完整),由你決定——資料庫不替你做這個決定。逐節配對資訊在「雙標一致性」分頁。
- 機關指涉的配對率是壓線通過的(70.1%)。四個欄位裡它最脆弱,用時請看逐筆證據。
- 分類尚未施加。對照表(來源→類別、概念→類別)還沒建;現在看到的是未分類的逐字抽取。
與隔離區的關係
v1–v3 的 1,514 篇標註仍在隔離中,不得使用。
那批資料六個欄位的編碼者間信度全部未達 .70(最低的制度角色主張只有 .391)。
v4 通過驗收後,將以 v4 全量資料取代隔離區——但在全量完成之前,
意見書層可靠的資料只有「全文語料」「標題結盟網」,加上這 40 篇 pilot。