ROOST Model Community
歡迎來到 ROOST Model Community(RMC)。RMC 的使命是讓開放安全 AI 模型更容易被安全社群取得,並能為社群帶來實際效益。為了達成這項使命,我們正建立一個由開發者、實務工作者、模型建立者,以及所有以保護網路空間為共同目標者組成的生態系。
RMC 希望同時為開放安全模型的現有與潛在使用者,以及這些模型的開發者(稱為 RMC Partners)帶來具體價值。參與 RMC 可獲得以下協助。
- 可信任的社群:我們只與符合品質要求、值得信任的開放安全模型合作。模型選擇方式請參閱資格標準。RMC 也透過定期活動及 Discord server 上的日常對話,維護社群討論、持續參與及共同解題。
- 教育與導入支援:我們分享資源,協助您理解開放安全領域,包括信任與安全 AI 入門指南及評估結果。準備採用特定模型時,RMC 也提供導入提示與文件,例如範例資料集,或與其他 ROOST 專案的直接整合。
- 持續改進:RMC 直接連結使用者與模型建立者,協助模型建立者依最新回饋持續更新模型。
瀏覽此 repo
此 repo 是尋找社群資源及 RMC Partner 模型資料的主要入口。如果想貢獻但不確定內容是否適合,歡迎提出 issue。
可直接在 GitHub 瀏覽目前的資源。
cope-b/:Zentropi 可自訂政策安全模型的資源與專案gpt-oss-safeguard/:OpenAI 可自訂政策安全推理模型的資源與專案mila/:Mila 自殺防治 guardrail 的相關資源projects/:不限定特定 RMC 模型的示範專案resources/:不限定單一 RMC Partner 的開放安全模型社群資源,包括以下內容。- RMC 開放安全模型使用指南,介紹如何在信任與安全架構的 Detection、Investigation、Review 與 Enforcement 階段應用開放安全模型
policy-packs/,由合作夥伴提供並依提交者分類的政策 prompt 套件,可直接搭配遵循政策的開放安全模型使用- 非 RMC 模型的其他程式碼片段與補充材料
加入我們
ROOST、合作夥伴及社群成員正持續建立適合協作的空間,但仍需要您的想法、專業與回饋,才能共同完成值得大家認同的成果。
- 參加雙週 office hours,直接與信任及安全同儕及 RMC 模型合作夥伴交流。可面對面討論實際成效、分享構想及其他經驗。
- 參加 project sprint。社群會定期舉辦短期協作,由成員共同完成安全社群面臨之廣泛問題的交付成果。參與完全自願,可依自身情況投入。
- 發起或加入模型使用討論。可檢視新的評估、研究發現、模型回饋及導入提示,或分享自己的經驗。您遇到的問題也可能正困擾其他人,這些回饋對實務工作者與可據此改進模型的建立者都很重要。
- 提出 issue,分享如何改善社群。例如可建議新的討論主題、issue label、文件或指南。
- 加入 Discord server,與其他實務工作者及模型建立者即時交流。社群相當活躍,但參與程度可依個人需求調整。這裡適合快速分享連結、提問、認識即將舉行的活動及互相學習。
RMC 對所有人開放,但主要服務希望提升平台安全,並想了解 AI 模型可以如何協助的開發者。他們可能在公司內擔任正式的信任與安全職務,也可能是自行維運去中心化社群平台的個人。
建立開放安全模型的開發者也是生態系的一部分,但深入的模型開發屬於另一個 AI/ML 工程領域,並非 RMC 的主要目的。
什麼是「開放安全模型」
模型的「開放」並沒有單一定義。開放性可以不同程度適用於技術堆疊的各個部分,從資料集、權重,到系統層級的防護機制與文件。ROOST 相信,開源方法可以擴大取得信任與安全工具的機會,並協助打造更安全的網際網路。同時,開源授權與規範應如何適用於 AI 系統,仍是尚未定論且持續演變的議題。
在 RMC 的使用範圍內,「開放安全模型」是符合以下條件的 AI 模型,包含但不限於大型語言模型及傳統分類器。
- 取得時不需支付費用,例如可免費下載權重
- 部署方式不受特定平台限制
- 專門針對信任與安全用途進行微調
此外,我們偏好未採非商業授權,且授權不限制輸出處理方式的模型。許多使用情境發生在商業環境中,也可能包含通報義務,例如兒童性虐待材料(CSAM)。這類授權限制與我們希望支援的信任與安全使用者需求不相容。
開放安全模型很多,但 RMC Partners 必須符合特定標準。模型如要正式成為 RMC partner,必須符合資格標準。我們會與 RMC partners 密切合作,在加入社群前確認模型符合標準。如對標準有疑問,歡迎聯絡我們。標準是依社群需求設計,也接受回饋。
RMC Partners
- Mila:Mila-Suicide-Prevention-Output-Guardrail
- OpenAI:gpt-oss-safeguard
- Zentropi:CoPE-B-A4B
RMC Partners 可獲得以下協助。
- 推廣模型,例如在 Office Hours 展示,或支援相關活動
- 共同製作模型導入資源,例如文件、導入提示,以及依需要與其他 ROOST 工具整合
- 協助整理產品回饋
我們希望為所有模型開發者建立友善、具包容性的社群。即使未完全符合合作夥伴資格標準,非合作夥伴的模型建立者仍隨時可以參與 RMC 活動。
如要討論成為 RMC Partner,請寄信至 hello@roost.tools。
開放模型協作方法
網路安全領域長期使用機器學習識別違反政策的內容。近期針對安全微調的 AI 模型帶來前所未有的能力,可依自訂規則偵測並分類有害內容。讓這些模型能被公開取得並整合至開源工具,可使過去只有資源充足組織才能使用的 AI 安全能力,擴及更多團隊。
傳統開源開發方法很適合軟體,但 AI 模型面臨不同挑戰。模型需要敏感訓練資料、大量運算資源,開發生命週期也與程式碼根本不同。
RMC 將開源軟體的開放存取與社群精神帶入 AI 模型協作,並由 AI 研究人員與模型建立者共同實現。合作夥伴承諾開發並公開釋出針對安全微調的模型權重,使其可免費取得、部署時不受平台限制,且授權不設商業或輸出限制。他們也會積極參與社群,蒐集實務工作者回饋並支援導入。ROOST 則培養活躍的實務社群,讓安全團隊分享在真實情境部署模型的知識與策略。