AI 如何偵測假新聞?五種方法與它們做不到的事
有些研究讓 AI 直接預測一則內容的真偽,但這類輸出不宜直接當作結論。本文聚焦另一種常見用法:從內容、來源、擴散、帳號與影像找出可疑訊號,縮小人工查證範圍;並整理五種方法的原理與限制,以及如何接到查證流程。
快速回答:AI 如何偵測假新聞?
AI 可從本文整理的五類訊號協助偵測假新聞:主張比對、來源可信度與源頭追溯、擴散模式、帳號協同行為,以及圖片與影音的多模態分析。它可協助篩選可疑訊號、縮小查證範圍,實際效果依資料覆蓋、模型與評測條件而定。系統產出的是可疑訊號與調查線索,不應僅憑 AI 輸出作出最終真偽認定;真偽認定、歸因與處置應由人工核對證據後決定。
先講清楚:「偵測」和「查核」是兩件事
評估工具前,應先區分偵測與查核。偵測回答「哪些內容值得優先查看」,屬於篩選與排序,可大量自動化;查核回答「這個說法是否屬實」,要找原始資料、比對官方紀錄並對結論負責。
把篩選標籤當作查核結論,可能忽略證據與模型限制;系統應說明挑出理由,再由查核人員判斷。還要再分一層:真偽由查核人員依證據判斷,是否違法由有權機關依法認定;被判為不實,不等於違法。
「假新聞」一詞本身也有侷限。Wardle 與 Derakhshan 於 2017 年為歐洲理事會(Council of Europe)撰寫的《Information Disorder》報告,把資訊失序分成錯誤資訊、假訊息與惡意資訊三類,並主張「fake news」一詞不足以描述這些現象。值得關注的內容也可能並非捏造,例如真實照片配上錯誤時地。
五種偵測方法:原理、適用範圍與限制
五種方法各看不同層次的訊號,實務上可以組合使用。以下用同一格式說明:原理、適合抓什麼、可能誤判、需要的資料。
一、主張比對(claim matching)
原理:把待檢內容拆成可查證的主張,例如某個數字、某項政策、某段引述,再以語意相似度與已查核主張的資料庫比對。重點在語意而非字面,因為同一主張可能被改寫、換標題、翻譯或轉製為圖卡再次流傳。
適合抓什麼:再度流傳的舊說法與其變體,例如在颱風、疫情或選舉期間重新出現的既有謠言,以及換了包裝的已查核內容。國內事實查核組織公開的查核結果,以及群眾協作的查證資料庫,可作為比對參考;使用時須確認授權與內容品質。
可能誤判:引述謠言再澄清的報導可能因高度相似被誤標;主張換個地點或數字,相似度又可能掉到門檻以下。根本限制是:沒有對應的查核紀錄時,無法直接提供既有查核結論。
需要的資料:持續更新的已查核主張資料庫、能處理繁體中文口語改寫的語意模型,以及含圖卡文字的完整內容。
二、來源可信度與傳播源頭追溯
原理:一方面評估發布者紀錄,例如網站建立時間、是否屢次發布錯誤內容、作者與聯絡資訊是否可查;另一方面沿轉貼與引用往回追,找出說法在目前可觀測資料中最早出現的時間與位置,以及中間經過哪些改寫。
適合抓什麼:偽裝成新聞網站的內容農場、冒用正式機構名義的訊息、來源不明卻被大量轉傳的截圖。
可能誤判:若過度依賴歷史紀錄,可能低估新成立的正當媒體,也可能放過信譽良好來源的偶發錯誤。源頭追溯受限於資料覆蓋:看不到的封閉群組或已刪貼文,會讓可觀測的最早版本被誤認為源頭。
需要的資料:跨平台、帶時間戳記的歷史資料,來源屬性紀錄,以及轉貼與引用關係;追溯品質取決於資料覆蓋、時間戳記與關聯紀錄是否完整。
三、擴散模式
原理:觀察訊息在時間與平台間的傳播形狀,把聲量短時間陡升、多平台幾乎同時出現相同敘事、冷門時段密集活動等現象列為待查訊號,再與自然事件、排程發布及議題基線對照。
適合抓什麼:異常聲量、跨平台接力(例如先在論壇出現,隨後在短影音與通訊群組擴散),以及聲量增長與議題基線明顯不符的話題。
可能誤判:突發事件、知名人士轉發或媒體報導也會造成聲量陡升。異常聲量只代表值得查看,不代表有人操弄,須對照同期新聞判讀。
需要的資料:多平台時間序列、議題與敘事分群,以及足以建立基線的歷史資料。
四、帳號協同行為
原理:看一群帳號之間的關係:發文是否高度同步、內容是否大量重複或少量改寫、是否頻繁互相轉發、帳號建立與活動歷程是否異常集中。協同性不真實行為(CIB)一詞來自社群平台的治理政策:Facebook(現 Meta)自 2020 年 7 月份的 CIB 月報起,將 CIB 描述為以假帳號為運作核心、為策略目標協同操弄公共討論的行為;該公司的下架公告也表示,處置依據是帳號的行為,而非貼文內容。這也是此類方法的出發點:先看行為是否協同且具欺騙性,而不是先判斷內容真假。
適合抓什麼:協同帶風向、以多帳號製造假性共識、同批帳號跨議題輪流動員。由於不依賴內容真假,也能發現以真實資訊選擇性放大的操弄。
可能誤判:真實的社群動員、粉絲應援與合法倡議都可能高度同步,使用排程工具的組織也有類似特徵。協同訊號屬機率性研判,需依情境調校門檻並由人工檢視帳號樣本,且不構成違法認定。
需要的資料:帳號公開欄位與活動紀錄、互動關係資料及足夠長的行為歷程;各平台開放欄位不同,分析深度也不同。
協同行為偵測在完整監測流程中的位置,可參考假新聞偵測與認知作戰監測系統的說明。
五、多模態分析:圖片、影片與深度偽造
原理:假訊息也可能以圖卡、截圖或短影音呈現。多模態分析以光學字元辨識(OCR)擷取圖片文字,讓圖卡進入主張比對;以反向圖片搜尋與來源追溯檢查舊圖新用,並以影像鑑識工具輔助檢查疑似修改;影片與深度偽造(deepfake)偵測則檢查臉部、聲音與畫面的不一致。
適合抓什麼:偽造的公文或新聞截圖、移花接木的舊照片、冒用公眾人物形象或聲音的合成影音,以及文字檢索搜不到的純圖片內容。
可能誤判:壓縮、轉檔與濾鏡可能改變模型依賴的特徵;合成影音也可能用於諷刺或二次創作,因此偵測到合成特徵,不等於存在欺騙意圖。偵測模型遇到訓練時未見過的生成方式或資料分布,表現可能退化,因此要搭配流傳歷程與當事人確認。
需要的資料:可取得的最高畫質版本、流傳歷程,以及持續更新的合成樣本。
五種方法比較總表
| 方法 | 看的訊號 | 適合的用途 | 限制 | 關鍵資料 |
|---|---|---|---|---|
| 主張比對 | 內容中的可查證主張 | 比對已查核過的舊說法與改寫版本 | 沒有查核紀錄時無法提供結論 | 已查核主張資料庫 |
| 來源與源頭追溯 | 發布者紀錄與轉貼路徑 | 協助篩出疑似冒名來源與內容農場 | 受限於未取得的封閉群組內容與未留存的已刪貼文 | 跨平台歷史資料 |
| 擴散模式 | 聲量曲線與跨平台時序 | 標出與基線不符的聲量變化,供人工判讀 | 需與真實熱門事件區分 | 時間序列與歷史基線 |
| 帳號協同行為 | 發文節奏、相似度、互動網絡 | 不以內容真假為判斷前提 | 可能混淆真實社群動員 | 帳號公開欄位與互動資料 |
| 多模態分析 | 圖片文字、畫面與聲音特徵 | 涵蓋文字檢索搜不到的圖片與影音 | 受壓縮與未見過的生成方式影響 | 高畫質檔案與流傳歷程 |
單一方法各有盲點,協同行為與多模態分析可補充內容比對看不到的面向,但也需要調校與人工驗證。實務上可結合不同訊號決定先看哪些內容,考量訊號品質、訊號是否彼此獨立及事件可能的影響,而非單純計算符合幾項。
生成式 AI 帶來的新變化:從字面比對延伸到敘事與行為
生成式 AI 讓產製近似但不相同的文本變得容易。依賴字面重複的比對,原本能抓出複製貼上的協同散播;當每個帳號都能取得語氣與用詞各異的改寫,這類比對可能失去效果。
因應方式是擴大觀察面,而非放棄內容分析:比對延伸到敘事層級,看不同說法是否推向同一結論;同時檢視帳號活動歷程、發文同步性、互動網絡與跨平台出現順序等時序資料。這些訊號同樣可能被刻意安排,有效性仍須在自己的資料上驗證。
另一個誤解是把「這段文字是不是 AI 寫的」當成偵測目標。正當使用者也用生成工具寫作,而生成文本經過再次改寫後,AI 文字偵測的辨識效果也可能下降。對假訊息查證而言,更該問的是主張是否可信、被誰以什麼方式推送。
合成影音門檻下降,多模態檢查可納入例行流程,並及早保存可取得的最高品質版本、網址與擷取時間,註明是否為原始檔。
為什麼準確率數字不一定可比
各方宣稱的準確率即使都是真實測得,也可能因評測條件不同而無法直接比較。下表列出四項應核對的評測條件,以及可以直接問供應商的問題。
| 評測條件 | 為什麼會影響數字 | 該問的問題 |
|---|---|---|
| 資料集 | 平台、期間、語言與題材會影響題目難度;英文新聞標題上的成績,不代表繁體中文論壇貼文或圖卡上的表現。 | 測試資料來自哪些平台與語言?是否包含自身關注的題材? |
| 標註準則 | 部分錯誤、誇大、諷刺、斷章取義是否算假新聞,各資料集定義可能不同;標註者之間的分歧,也會影響標準答案的可信度與評測解讀。 | 標註準則是什麼?由誰標註?多人標註意見分歧時如何處理? |
| 正負樣本比例 | 若實際可疑內容比例低,即使模型在正負各半的測試集上表現良好,警示中的誤報比例仍可能偏高;因此要看精確率與召回率,不只看準確率。 | 測試集的正負樣本比例為何?能否提供接近真實比例下的精確率與召回率? |
| 時間漂移 | 議題、用語與手法會變;與訓練資料同期的測試,可能無法反映未來期間的表現,應另做跨期間評測。 | 測試資料是否晚於訓練資料?模型多久更新一次,如何監控表現衰退? |
公開評測之外,也可以用自有資料回測:涵蓋多種已知事件與正常期間,觀察工具在事件擴大前是否產生警示,以及正常期間的誤報量。
從偵測結果到查證:四個作業原則
偵測工具產出的是待查清單,後續仍需要查證與判斷。以下是常見的作業原則,可依組織規模與資源調整。
可疑訊號先經人工查證。不直接採用模型標籤,而是回到原始貼文、原始資料與官方紀錄核對證據。同時了解工具的適用條件與限制,例如資料涵蓋哪些平台、對哪些語言或內容形式表現較弱。篩選依據最好能被說明,且不以政治立場作為判準。
及早保存證據。內容可能遭刪改,應及早保存截圖、原始連結與擷取時間,並註明是否為原始檔;涉及法律程序時,另確認保存與鑑識方式。
澄清時避免放大原始謠言。常見的建議是先陳述正確資訊,再簡短指出錯誤說法與錯在哪裡,最後重申正確資訊,避免在標題或開頭重複原始謠言。
拿捏回應時機。太早回應可能替小範圍謠言帶來注意,太晚則可能讓錯誤說法先占據討論;擴散分析可作為時機判斷的參考。
公部門導入時要先講清楚界線。公開來源仍可能包含個人資料,蒐集與保存的範圍、用途、權限與期限,應依適用規範與機關職務需求確認;監測目標是查證與澄清,而非針對特定言論者,系統標籤與協同訊號都不構成違法認定。