Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

Teen Safety Policy Pack

在 Hugging Face 下載 gpt-oss-safeguard-120bgpt-oss-safeguard-20b

試用 gpt-oss-safeguard · 指南 · Model card · OpenAI blog

Teen Safety Policy Pack 是一組以 prompt 為基礎的安全政策,用來為青少年建立符合年齡的保護措施。

這些政策採 prompt 結構,可直接搭配 gpt-oss-safeguard 使用,讓開發者將安全要求轉換為可供真實系統使用的分類器。

使用此 repo 須遵守使用政策Apache 2.0 授權

如何使用政策

  1. example_policies/ 選擇最符合待評估青少年安全風險的政策。每項政策位於獨立資料夾,prompt 文字在 policy.md
  2. 將政策 prompt 與要分類的內容一起傳給 gpt-oss-safeguard。模型應以 prompt 中的政策 label 與範例作為判斷框架。
  3. 依政策定義的 label 審查模型輸出,再對應到產品工作流程,例如即時過濾、離線審查、分流或監測。
  4. 依產品、受眾及操作脈絡調整 prompt。這些政策是起點,不是固定規則集。
  5. 發布 prompt 變更前,先執行 datasets/ 中對應的驗證資料集,衡量修改如何影響表現。

初始政策範圍

第一版涵蓋以下內容。

  • 露骨暴力內容(graphic-violent-content
  • 露骨性內容(graphic-sexual-content
  • 有害身體理想與行為(harmful-body-ideals
  • 危險活動與挑戰(dangerous-content
  • 危險或不適當的角色扮演(dangerous-roleplay
  • 限制年齡之商品與服務(age-restricted-goods-and-services

這些政策可用於即時內容過濾,也可用於離線分析使用者產生內容。

政策採 prompt 結構,使開發者更容易整合至既有工作流程、依使用情境調整,並持續改進。

驗證資料集

政策驗證資料集位於上游 datasets/,每個政策都有自己的 CSV 檔案。檔名與 example_policies/ 中的 policy slug 相同,便於在 prompt 調整及 regression test 時,將 prompt 與評估資料集配對。

如何貢獻

這些政策透過 ROOST Model Community 以開源方式發布,鼓勵共同協作與改進。如要貢獻、提供回饋或分享其他青少年安全政策,請前往 RMC GitHub repo。

限制

這些政策是起點,並非青少年安全的完整或最終定義,也不提供保證。每個應用程式都有不同的風險、受眾及脈絡。開發者最了解產品及 AI 整合可能造成的風險。我們強烈建議依具體需求調整及擴充政策,並搭配其他防護措施。

台灣繁體中文第一輪翻譯保留原始 label 與 prompt 結構,但尚未完成兒少安全、模型評估、法律或平台政策審查。正式使用前必須以本地語言資料重新評估,不得把來源範例直接視為自動處置標準。