Agentic Safety 實體與訊號結構參考
本頁把四份可執行 YAML 的結構整理為不可執行的繁中參考文件。英文鍵名、實體名稱與列舉值刻意保留,方便對照來源。請勿把本頁轉回設定檔後直接部署,平台資料模型、API 權限、個人資料處理及稽核機制仍須由負責團隊審查。
本頁涵蓋以下固定來源檔案
abstract_entity_schema.yamlsignals.yamldiscord_entity_schema.yamlyoutube_entity_schema.yaml
抽象實體模型
這份模板提供信任與安全調查的最小實體模型。平台應刪除不存在的實體、加入實際需要的實體,並保留 edges 與 signals,讓 agent 能規劃資料關聯的走訪方式。
| 實體 | 用途 | 主要關聯 |
|---|---|---|
Actor | 在平台上行動的使用者、bot、組織或系統 | 發布內容、成員關係、審核決策 |
Space | 伺服器、社群、頻道、貼文或播放清單等有界容器 | 擁有者、上層空間、內容、成員 |
Content | 貼文、留言、訊息、反應或影片等使用者內容 | 作者、空間、父內容、回覆、決策 |
Membership | Actor 與 Space 的加入、角色、封禁或付費關係 | 使用者與空間 |
Cluster | 偵測器建立的使用者或內容群組 | 群組成員、案件 |
ModerationDecision | 對實體採取的具體審核行動 | 決策者、證據內容、使用者與群組 |
Report | 使用者或系統提出的檢舉 | 提報者與被檢舉目標 |
Case | 彙整檢舉、證據、群組與決策的調查案件 | 檢舉、群組、決策與審查人員 |
Event | 任一實體的狀態變化 | 規則引擎與稽核紀錄 |
識別碼採 platform_ref,由 platform 與 platform_id 組成。可指向不同實體的欄位使用 polymorphic_ref,另以 target_kind 標示目標種類。必要欄位、資料型別及關聯方向均以來源 YAML 為準。
重要列舉
來源定義 actor_type、space_kind、content_kind、membership_kind、membership_state、visibility、cluster_kind、decision_source、decision_action、severity、appeal_state、target_kind、report_state、case_state、subject_kind 與 event_verb。harm_category 由 harm_taxonomy.yaml 提供。
decision_action 包含 content_remove、content_hide、content_label_attach、content_demote、ban_from_space、timeout、account_suspend 與 cluster_flag。這些名稱只描述來源資料契約,不表示任何行動已獲准。
Agent 契約
signals中的名稱必須能在signals.yaml找到同名定義,並以platform_ref綁定實體- 走訪關聯時須讀取
edges的方向、目標、連結欄位、基數及when條件 - 平台沒有提供的欄位應設為 null,並在產生的
Event.source_fidelity記錄缺漏 - 長篇平台說明應留在 fork 的註解,不應擴張核心模板
訊號槽位
signals.yaml 是待平台綁定的 stub。來源要求移除不用的槽位,並把保留項目接到真實的評分器、資料儲存及處理管線。過期訊號不得視為權威資料。
| 訊號 | 綁定實體 | 來源語意摘要 |
|---|---|---|
reputation | Actor | 90 天滾動行為分數,較高代表較安全 |
trust_tier | Actor | untrusted 至 partner 的粗略信任層級 |
device_fingerprints | Actor | 經雜湊的裝置或瀏覽器環境,可能提示多帳號操作 |
session_anomaly_score | Actor | 地理跳躍、速度或裝置不符等登入異常 |
cluster_memberships | Actor | 所屬群組與信心分數,可回查 Cluster |
harm_labels | Content | 分類器回傳的類別、嚴重度與信心 |
similarity_hash | Content | 近似內容查找用的感知或文字雜湊 |
near_duplicate_cluster | Content | 內容所屬的近似重複群組 |
classifier_scores | Content | 模型名稱對應分數的映射 |
risk_score | Space | 綜合近期審核率、成員信譽與申訴密度的風險 |
recent_moderation_rate | Space | 最近 24 小時每 1,000 項內容的審核行動數 |
coordination_score | Cluster | 時間群聚、共用裝置與內容相似度形成的協同行動分數 |
confidence | Cluster | 分群管線認定群組並非雜訊的信心 |
freshness 是使用限制的一部分。來源分別使用 realtime、on_create、hourly 與 daily,整合者應明確拒用已過期的值。
Discord 實體對應
Discord schema 版本為 0.4,將抽象模型具體化為 User、GuildMember、Guild、Channel、Message、Attachment、Emoji、Webhook、Invite、AutoModerationRule、GuildBan 與 AuditLogEntry。
主要對應關係如下
User對應ActorGuild與Channel對應不同層級的SpaceMessage、Attachment與Emoji對應ContentGuildMember對應MembershipGuildBan與AutoModerationRule提供治理狀態,AuditLogEntry提供事件線索
來源特別要求檢查 Discord privileged intents,不能假設 bot 可讀取所有成員或訊息。Audit Log 也不是完整事件串流,webhook 可能放大濫用。調查協同行為時,應由訊息作者、近似內容與裝置訊號往 Cluster 與 Case 走訪,且要避免因共用裝置就直接認定違規。
YouTube 實體對應
YouTube schema 版本為 0.4,參考 YouTube Data API v3、YouTube Live Streaming API、Content ID API 與 推播通知指南。
來源定義 Channel、Membership、Video、Playlist、Comment、LiveBroadcast、LiveChatMessage、LiveChatBan 與 Claim。
主要對應關係如下
Channel同時具有帳號與發布者角色,對應抽象ActorVideo、Comment與LiveChatMessage對應不同型態的ContentPlaylist與LiveBroadcast可作為SpaceMembership表示創作者頻道與會員頻道的關係Claim表示 Content ID 權利聲明及處置政策
YouTube 的搜尋、推薦、訂閱、播放清單與直播等發現介面各有不同資料可見性。擁有者授權是管理 API 的必要界線,來源也指出 API 無法讀取完整濫用檢舉。涉及兒童內容時須保留 made_for_kids 及 self_declared_made_for_kids 等欄位供稽核,不能由 agent 自行推定 COPPA 法律結論。
採用前檢查
- 由平台團隊把欄位綁定到實際資料來源,並確認缺漏與更新頻率
- 由隱私與資安負責人審查裝置指紋、群組關係、私訊及權限資料
- 由治理團隊核定類別、嚴重度、可採行行動、申訴與人工覆核路徑
- 建立唯讀測試、稽核紀錄、速率限制、停止開關與回復機制
- 通過平台特定測試後,才可另行建立可執行設定