Meta AI 領域:訓練資料的資訊透明度
Meta 很高興能在 Meta 產品中將人工智慧(AI)體驗帶給全球各地的用戶和商家。
什麼是 Meta AI 領域?
Meta AI 技術整合了多項生成式 AI 功能和體驗,例如 Meta AI 和 AI 廣告創意工具,以及提供相關技術支援的各種模型。其中也包括我們透過開放平台提供的模型,為研究人員、開發人員和 AI 社群的其他成員提供支援。Meta AI 領域可協助用戶解決複雜的問題、發揮更多的想像力,以及建立前所未見的內容。無論是在聊天中即時回覆、協助用戶組織和規劃未來假期,或是提供用戶更多展現自我的方式,Meta AI 領域都能夠協助用戶提升日常活動、體驗和重要時刻。
以下詳細說明我們用於 Meta AI 領域的資訊、資訊來源以及運作方式。
| 資料來源 資料來源為何? | 我們用於開發和改善 Meta AI 領域的資訊包括一系列來自 Meta 產品和服務的公開資料、授權資料和資訊,包括來自 Instagram 和 Facebook 的公開分享貼文,以及用戶與 Meta AI 領域功能的互動資料。 |
| 預期用途 這些資料如何協助 Meta AI 領域執行其預期用途?
| 用於訓練 Meta AI 領域的資料集皆經過精選,以確保模型能以準確、相關且對我們產品用戶而言安全的方式來瞭解及生成語言、音訊、圖像和影片。
|
| 資料量 建立 Meta AI 領域時用了多少資訊或資料點? | Meta AI 領域使用各種模型類型和大小,以針對不同成效和使用案例需求進行最佳化。一般來說,模型是根據數兆個符元進行訓練,每個權杖各是不同類型的資訊。符元可以是一個單字(或單字的一部分)、一張圖像,或影片中的幾毫秒。 |
| 資料類型 使用了哪種資訊或資料點? | 訓練 Meta AI 領域時,我們主要使用未標記的資料,包括來自可公開取得和授權來源的原始文字、圖像、音訊、影片和相關資訊。將標籤套用到資料後,標籤可能會顯示觀感、主題、安全性、相關性、圖像說明文字或人工評分等資訊。 |
| 受保護的資料 我們使用的資料中是否有受著作權、商標權或專利保護的資料? | Meta AI 領域所用的資料集包括各種公開可用、已獲授權和用戶產生的資料。資料的著作權、商標和專利狀態取決於特定資料的性質,以及相關智慧財產權法律的適用情況等因素。 |
| 購買或授權的資料 資料集是否經過購買或授權? | 部分資料集是從第三方購買或取得授權,包括商業資料集和合作夥伴內容。 |
| 個人資料 資料集是否包含個人資料 | 用於訓練 Meta AI 領域的資料集可能包括用戶在我們產品上公開分享或透過與 Meta AI 領域互動所提供的名稱或其他詳細資料等資訊。 |
| 彙總消費者資訊 資料集是否包含無法用於識別用戶的彙總資訊? | 用於訓練 Meta AI 領域的資料集可能包括彙總(即合併)的消費者資訊,例如群組層級的統計資料或去識別化的彙總資料。 |
| 資料處理 若資料已經過處理或修改,這麼做的用意為何? | Meta 有時會重新格式化資料和/或套用標籤,以訓練和評估模型。Meta 會對用於 AI 系統的資料集進行大規模的清理、處理和修改。這些相關作為可能包括將某些資料去識別化並加以彙整、移除重複和劣質內容,以及採用隱私和安全防護措施。這麼做旨在保護用戶隱私、協助確保資料品質和安全性,以及支援負責且有效的 Meta AI 領域開發。 |
| 合成資料 目前或過去是否曾使用任何合成資料? | Meta AI 領域會生成並使用合成資料來建立和改善其生成式人工智慧系統和服務。合成資料的生成和應用會用於幾種用途,包括:
|
| 開始使用資料 首次使用資料的時間為何? | Meta AI 領域是使用持續收集和併入的資料集來進行開發和改善。由於資料的收集和整合持續在進行,因此並沒有一個首次使用所有資料集的特定日期。為改善 Meta AI 領域,我們會定期新增以下來源的資料:
|
| 資料收集 資料收集的時間範圍為何? | Meta 會持續收集和使用資料集來訓練和改善 Meta AI 領域。Meta 不會只在單一時間範圍內收集所有資料,而是會使用來自以下資料來源的新資訊持續更新資料:
|