Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

Policy Agent 生成政策版本參考

本頁整理 policy_v001.mdpolicy_v002.mdpolicy_v003.md 三個自動生成版本。為避免未經審查的模型政策被直接複製使用,本頁不重製可直接送入分類模型的完整提示詞,也省略涉及兒少性內容、自傷、仇恨與露骨暴力的原始測試句。三份英文來源仍是唯一完整版本,尚未經語言、領域或效能審查。

共通輸出契約

三個版本都要求獨立判斷八個分類,並只輸出 JSON 物件。每個欄位的值為 0 或 1。

代碼分類摘要
SSexual以性喚起、性行為描述、性服務招攬或露骨身體部位為主的內容
HHate針對受保護群體表達、推廣或鼓勵仇恨,且不含明確暴力號召
VViolence描寫、歌頌、威脅或教導暴力,但未達露骨細節程度
HRHarassment對個人或受保護群體進行恐嚇、霸凌、揭露個資或威脅
SHSelf-harm鼓勵、美化或呈現自殺、割傷、飲食疾患或物質相關自傷
S3Sexual / Minors涉及、描述或性化未滿 18 歲者的任何性內容
H2Hate / Threatening仇恨內容同時包含直接或間接暴力、滅絕或消滅威脅
V2Violence / Graphic以震撼、煽情或戀物方式呈現極度露骨、血腥或醫療細節的暴力與自傷

分類可以同時成立。例如來源允許 H2HV2V 同時為 1。這代表欄位不是互斥類別。

v001

第一版提供八個分類的基本定義、違規與安全條件,各附兩組一般範例,最後規定只回傳 JSON。其條文範圍較廣,部分概念的邊界較模糊,例如一般刻板印象與仇恨、醫療傷勢描述與露骨暴力之間缺少精細條件。

此版本可視為基線,不應由版本號推定已通過任何評估。

v002

第二版將定義改為表格,明確要求各類別獨立判斷,且禁止輸出解釋文字。它進一步區分以下邊界

  • H 聚焦於貶抑、去人化、排除或煽動敵意,非暴力的一般負面意見不一定違規
  • V 增加暴力威脅與操作指示,並將新聞、歷史、非煽情虛構及事實性自衛資訊列為安全脈絡
  • HR 加入揭露個資、協同羞辱及暗示暴力的語句
  • SH 加入將自傷當成因應方式、美化或詳細幻想的情況
  • S3 明列校服、teen、cheerleader 等可能暗示未成年人的語境線索
  • V2 強調令人震撼或煽情的肢解、自傷及類驗屍細節

第二版另加入前一次誤判與漏判的邊界案例。這些案例只顯示政策調整方向,來源沒有附上獨立測試集、混淆矩陣或統計顯著性。

v003

第三版延續第二版結構,主要強化 HRSHV2

  • HR 明列暗示性威脅與預測暴力結果的語句,即使沒有露骨細節也可能成立
  • SH 明列為了促成自傷而使用物質的內容,同時移除純粹令人不適但未指向自傷的誤判案例
  • V2 納入屍體毀損、食人或肢解等以血腥為焦點的內容,即使文字未採醫療精確描述
  • 新的邊界案例反映先前在騷擾、自傷與露骨暴力分類上的誤判與漏判

第三版縮短部分安全與違規條件,但版本較新不代表效能一定較好。任何採用決策都應以相同、獨立且具代表性的資料集重新比較三版。

驗證與發布界線

  1. 保留三版來源與評估資料的固定雜湊,避免政策與結果錯置
  2. 以獨立測試集分別評估每個分類的 precision、recall、誤判與漏判
  3. 對兒少、自傷、仇恨及暴力內容進行專業審查,並建立危機升級與申訴流程
  4. 檢查繁中語意、台灣用語及文化脈絡,不能把英文邊界案例直接視為繁中表現證據
  5. 先採影子模式並保存可回復版本,通過人工核准後才可考慮正式使用