Policy Agent 生成政策版本參考
本頁整理
policy_v001.md、policy_v002.md與policy_v003.md三個自動生成版本。為避免未經審查的模型政策被直接複製使用,本頁不重製可直接送入分類模型的完整提示詞,也省略涉及兒少性內容、自傷、仇恨與露骨暴力的原始測試句。三份英文來源仍是唯一完整版本,尚未經語言、領域或效能審查。
共通輸出契約
三個版本都要求獨立判斷八個分類,並只輸出 JSON 物件。每個欄位的值為 0 或 1。
| 代碼 | 分類 | 摘要 |
|---|---|---|
S | Sexual | 以性喚起、性行為描述、性服務招攬或露骨身體部位為主的內容 |
H | Hate | 針對受保護群體表達、推廣或鼓勵仇恨,且不含明確暴力號召 |
V | Violence | 描寫、歌頌、威脅或教導暴力,但未達露骨細節程度 |
HR | Harassment | 對個人或受保護群體進行恐嚇、霸凌、揭露個資或威脅 |
SH | Self-harm | 鼓勵、美化或呈現自殺、割傷、飲食疾患或物質相關自傷 |
S3 | Sexual / Minors | 涉及、描述或性化未滿 18 歲者的任何性內容 |
H2 | Hate / Threatening | 仇恨內容同時包含直接或間接暴力、滅絕或消滅威脅 |
V2 | Violence / Graphic | 以震撼、煽情或戀物方式呈現極度露骨、血腥或醫療細節的暴力與自傷 |
分類可以同時成立。例如來源允許 H2 與 H、V2 與 V 同時為 1。這代表欄位不是互斥類別。
v001
第一版提供八個分類的基本定義、違規與安全條件,各附兩組一般範例,最後規定只回傳 JSON。其條文範圍較廣,部分概念的邊界較模糊,例如一般刻板印象與仇恨、醫療傷勢描述與露骨暴力之間缺少精細條件。
此版本可視為基線,不應由版本號推定已通過任何評估。
v002
第二版將定義改為表格,明確要求各類別獨立判斷,且禁止輸出解釋文字。它進一步區分以下邊界
H聚焦於貶抑、去人化、排除或煽動敵意,非暴力的一般負面意見不一定違規V增加暴力威脅與操作指示,並將新聞、歷史、非煽情虛構及事實性自衛資訊列為安全脈絡HR加入揭露個資、協同羞辱及暗示暴力的語句SH加入將自傷當成因應方式、美化或詳細幻想的情況S3明列校服、teen、cheerleader 等可能暗示未成年人的語境線索V2強調令人震撼或煽情的肢解、自傷及類驗屍細節
第二版另加入前一次誤判與漏判的邊界案例。這些案例只顯示政策調整方向,來源沒有附上獨立測試集、混淆矩陣或統計顯著性。
v003
第三版延續第二版結構,主要強化 HR、SH 與 V2。
HR明列暗示性威脅與預測暴力結果的語句,即使沒有露骨細節也可能成立SH明列為了促成自傷而使用物質的內容,同時移除純粹令人不適但未指向自傷的誤判案例V2納入屍體毀損、食人或肢解等以血腥為焦點的內容,即使文字未採醫療精確描述- 新的邊界案例反映先前在騷擾、自傷與露骨暴力分類上的誤判與漏判
第三版縮短部分安全與違規條件,但版本較新不代表效能一定較好。任何採用決策都應以相同、獨立且具代表性的資料集重新比較三版。
驗證與發布界線
- 保留三版來源與評估資料的固定雜湊,避免政策與結果錯置
- 以獨立測試集分別評估每個分類的 precision、recall、誤判與漏判
- 對兒少、自傷、仇恨及暴力內容進行專業審查,並建立危機升級與申訴流程
- 檢查繁中語意、台灣用語及文化脈絡,不能把英文邊界案例直接視為繁中表現證據
- 先採影子模式並保存可回復版本,通過人工核准後才可考慮正式使用