Teen Safety Policy Pack
在 Hugging Face 下載 gpt-oss-safeguard-120b 與 gpt-oss-safeguard-20b
試用 gpt-oss-safeguard · 指南 · Model card · OpenAI blog
Teen Safety Policy Pack 是一組以 prompt 為基礎的安全政策,用來為青少年建立符合年齡的保護措施。
這些政策採 prompt 結構,可直接搭配 gpt-oss-safeguard 使用,讓開發者將安全要求轉換為可供真實系統使用的分類器。
使用此 repo 須遵守使用政策與 Apache 2.0 授權。
如何使用政策
- 從
example_policies/選擇最符合待評估青少年安全風險的政策。每項政策位於獨立資料夾,prompt 文字在policy.md。 - 將政策 prompt 與要分類的內容一起傳給
gpt-oss-safeguard。模型應以 prompt 中的政策 label 與範例作為判斷框架。 - 依政策定義的 label 審查模型輸出,再對應到產品工作流程,例如即時過濾、離線審查、分流或監測。
- 依產品、受眾及操作脈絡調整 prompt。這些政策是起點,不是固定規則集。
- 發布 prompt 變更前,先執行
datasets/中對應的驗證資料集,衡量修改如何影響表現。
初始政策範圍
第一版涵蓋以下內容。
- 露骨暴力內容(
graphic-violent-content) - 露骨性內容(
graphic-sexual-content) - 有害身體理想與行為(
harmful-body-ideals) - 危險活動與挑戰(
dangerous-content) - 危險或不適當的角色扮演(
dangerous-roleplay) - 限制年齡之商品與服務(
age-restricted-goods-and-services)
這些政策可用於即時內容過濾,也可用於離線分析使用者產生內容。
政策採 prompt 結構,使開發者更容易整合至既有工作流程、依使用情境調整,並持續改進。
驗證資料集
政策驗證資料集位於上游 datasets/,每個政策都有自己的 CSV 檔案。檔名與 example_policies/ 中的 policy slug 相同,便於在 prompt 調整及 regression test 時,將 prompt 與評估資料集配對。
如何貢獻
這些政策透過 ROOST Model Community 以開源方式發布,鼓勵共同協作與改進。如要貢獻、提供回饋或分享其他青少年安全政策,請前往 RMC GitHub repo。
限制
這些政策是起點,並非青少年安全的完整或最終定義,也不提供保證。每個應用程式都有不同的風險、受眾及脈絡。開發者最了解產品及 AI 整合可能造成的風險。我們強烈建議依具體需求調整及擴充政策,並搭配其他防護措施。
台灣繁體中文第一輪翻譯保留原始 label 與 prompt 結構,但尚未完成兒少安全、模型評估、法律或平台政策審查。正式使用前必須以本地語言資料重新評估,不得把來源範例直接視為自動處置標準。