數位時代 Business Next
Avsnitt

數位關鍵字256.Claude 怎麼讓看不見的記號埋進文字?IBM 首席科學家陳品諭拆解 AI 浮水印

Dela

8 月 11 日,Anthropic 在官方說明文件公告,8 月 2 日之後推出的 Claude 模型出廠就會在生成的內容裡埋入一個看不見的記號,全球適用,涵蓋 Claude、Claude Code、Claude Cowork 與開發者用的 API。但怎麼做到的沒有公布規格,偵測工具也還沒開放。消息一出,中英文社群立刻開始討論怎麼把它洗掉,GitHub 上也冒出各種浮水印檢查工具。IBM 華生研究中心可信任 AI 團隊首席研究科學家陳品諭 Pin-Yu 認為,多數人一開始就搞錯了這件事的性質:浮水印能證明的是「這段文字是不是我做的」,不是「這段文字是不是 AI 做的」。數位時代創新長黃亮崢 James 邀請陳品諭,從技術原理、歐盟法規動機,一路談到教育、出版與內容產業真正該擔心的事。

聽完這集,你可以學到

1. 浮水印保護的是模型商,不是使用者:陳品諭用命案現場比喻。現場有好多個嫌疑犯,每個人都能出來證明自己有不在場證明,「所以你只能證明這個人不是我殺的,但是這個命案還是發生了」。各家廠商的浮水印只能回答「這是不是我產生的」,惡意使用者只要下載一個開源模型自己生內容,就完全不帶任何記號。他形容這是一個安全漏洞:每個廠商都在保護自己,沒有人在保護一般使用者。

2. 文字浮水印不是在文字上加東西,而是動了選字的機率:早期做法是挑一組關鍵字,出現太頻繁就判定是 AI 寫的,但這會直接傷害生成品質,等於你請阿嬤倒茶,它卻端出一杯美式拿鐵。Google 那一系列比較進階的做法,是在決定下一個字的時候,心中先默想一個號碼(私鑰),用這個號碼加上已經產生的內容去決定下一個字;檢測時再把文字套回這個號碼,看相符的可能性有多高。

3. 藏在文字之外的記號,複製貼上就沒了:加隱形空格、把拉丁字母 A 換成看起來一模一樣的西里爾字母 A、或在文件裡塞白色文字,這些方法可以做,但當不了合格的浮水印。陳品諭解釋,只要使用者把內容複製到記事本,框選範圍以外的東西全部不會跟著走。而且這類手法缺乏獨特性,對方一旦知道你的規則就能改回去,浮水印要有效就必須做在文字本身。

4. 改寫確實能洗掉,但要改到面目全非:Google 發表在《Nature》的那份報告做過測試,更動少於 10 個 token 通常拿不掉浮水印,但改得夠多、改到面目全非,浮水印就會失效。社群討論的「拼盤」做法,也就是把五個段落分別丟給五個不同模型重寫、或翻成英文再翻回中文,陳品諭直接確認那是一個能把浮水印移除的好例子。

5. 中文不會比較安全:現在的主流架構 Transformer 是一個 token 進、一個 token 出,token 不等於英文單字或字母,任何語言都能拆成 token,圖片、聲音、影像同樣可以。陳品諭明確表示,不同語言對浮水印來說沒有差別,浮水印都能用上去。想靠中文方塊字躲過機率式浮水印,在技術上並不成立。

6. Anthropic 自己在網頁最下面寫了兩條免責:第一,這個技術沒有辦法保證一段文字是不是 AI 產生的,它只能保證是不是自家寫的。第二更關鍵,如果原始文字是使用者餵進來、由 Claude 修改的,它一樣會蓋上記號,但不保證那段原始文字本來是人寫的還是 AI 寫的。陳品諭形容就是「你給我一個東西,我蓋一個章我就把它丟出去」,至於進來的時候是什麼,它不管。

7. 歐盟的立法精神認為文字是相對最不需要保護的:陳品諭透過 IBM 參與過歐盟法規建議。相對於圖片、語音、影片,文字的傳播力與殺傷力較小,也比較容易查證,例如有人偽造一首詞說是方文山寫的,上網查一下沒有這首歌就破功了。這是風險管理的判斷,也解釋了為什麼 Google 只開源了文字浮水印,跟深偽高度相關的影像與語音方法始終沒有公開。

8. 開源偵測器會變成攻擊者的練習對象:陳品諭三年前用對抗式學習做的文字偵測器 RADAR,訓練時額外放進一個負責不斷重寫文字、想繞過偵測的 AI 攻擊者,讓偵測器學會更穩健的判斷方式。這個模型放上 Hugging Face 之後累積超過九十萬個下載次數,但他坦言心裡也有點怕,因為惡意使用者同樣可以拿它來磨練繞過的方法。這也是他判斷各家廠商最終不會開源自家浮水印偵測器的原因。

9. 人機混寫是灰色地帶,現有偵測器處理不了:訓練偵測器時的資料標註只有兩種,整段人寫或整段 AI 寫。但真實情況是人先寫草稿、AI 改了兩成或三成,要改到多少才算 AI 寫的?陳品諭認為這種灰色空間不好標註也不好預測。學生若能拿出 Word 的編輯紀錄,證明是自己一個字一個字打出來、中途只是參考 AI 的建議改錯字,他認為那還算是人寫的。

文字工作者真正要擔心的不是被蓋章,是被誤判。陳品諭今年做的一項研究正是在探討嫁禍:在圖片領域,他們可以把 A 模型的浮水印放進 B 模型產生的圖片裡,讓偵測器誤認來源,文字雖然還沒做過,但原理上可行。誤判在教育現場是致命的,把學生的文章誤判成 AI 寫的而當掉,學生的權益就受損。他也點出目前社會靠「AI 味」判斷的困境:老師看得出來文字老練到不可能是高中生寫的,卻拿不出證據,最後只能說是自由心證。

generation is cheap, but verification is hard(生產容易,但驗證難)。這是陳品諭常掛在嘴邊的一句話,生產內容很容易,檢驗內容的真實性與可靠性反而困難,而且通常需要領域專家才做得到。他舉例,市面上號稱能檢測 AI 論文的工具,實際上多半只查得出參考文獻是真是假,因為那可以拿資料庫比對;至於最前沿、大家都還不知道答案的研究內容,反而無法驗證。他認為這個時代該問的不是「這是 AI 做的還是人做的」,而是「做出來的成品有沒有更好」。

陳品諭給聽眾的心法

對於拿到偵測報告的主管、老師與評審,陳品諭的建議是把它當成健康檢查,不是判決書。那個數字只是最初步的檢測,發現不對勁應該往下追問原因,請對方提出自己編輯過程的思索與證據,而不是直接下結論。他也提醒,正因為他們做的是可信賴的 AI,才更清楚現階段的 AI 很多時候還不足以被人類信賴:「不要完全相信 AI 告訴你的任何事,你還是要有自己的判斷能力。」

至於一般工作者該怎麼面對 AI,他的立場很明確:不要想著 AI 要來取代人類,而是用 AI 讓自己的生產力更高、思考得更深遠,就像 AlphaGo 之後,職業棋手選擇跟 AI 下棋不是為了贏它,而是為了想得比十步、二十步更遠。但他也留下一句提醒:「AI 會的東西不是你會的東西,不是因為你會用 AI 就表示這個知識就是你的,你只是會使用這個工具而已。」

關鍵字附錄

一、技術名詞

  • Token:AI 模型處理內容的最小單位。它不等於一個英文單字或一個字母,而像一本字典裡的條目,可以是中文的字、一個字串,圖片、聲音、影像同樣可以拆解成 token。
  • Transformer:目前主流 AI 模型的架構,特性是一個 token 一個 token 讀入、再一個 token 一個 token 產出。文字浮水印之所以與語言無關,關鍵就在這個機制。
  • 文字浮水印(Text Watermarking):在模型產生下一個 token 時,依據一組私密金鑰去調整選字機率,讓產生出來的文字帶有可被統計檢測的特徵。與「在文末加註本文由 AI 產生」那種免責聲明不同,後者不算浮水印。
  • 數位簽章(Digital Signature):歐盟 AI 法案認可的另一種標記方式,在檔案本身的欄位裡記錄由誰簽名、來源為何。限制是能涵蓋的檔案格式有限,不是所有內容都能存成帶簽章的格式。
  • 提示詞注入(Prompt Injection):學術會議目前用來抓偷懶審稿人的手法。在投稿 PDF 裡加入白色的隱形文字,指示 AI 在產生審稿意見時必須包含某組幾乎不可能自然出現的字詞組合,一旦出現就構成合理懷疑。嚴格說這不是浮水印。
  • 對抗式學習(Adversarial Learning):安全研究的核心思維,設計防禦的同時就假想惡意使用者會如何破解。陳品諭的偵測器就是引入一個負責改寫文字、想要繞過偵測的 AI 攻擊者,讓偵測器在對抗中學會更穩健的判斷。
  • 模型蒸餾(Distillation):用領先的閉源模型產生問答資料,再拿這些資料訓練自己的模型,使其逼近對方的能力。近期多有報導指出部分開源模型可能以此方式訓練,這也是浮水印可能被拿來當作侵權證據的原因。
  • 安全護欄(Safety Guardrail):為 AI 產品加上的各種安全性防護。陳品諭以防火牆比喻:你需要它,但不能讓它耗掉跟作業系統一樣多的資源,否則再安全也沒有人會用。實務上偵測器已能做成小模型,不必動用與生成同等規模的算力。
  • 深度偽造(Deepfake):以 AI 偽造圖片、語音或影片。歐盟法規的關注重心在此,而非文字,因為影音的傳播力與辨識難度都遠高於文字。

二、法規與事件

  • 歐盟人工智慧法案(EU AI Act):2026 年 8 月初上路,要求 AI 生成內容留下機器可讀的標記,罰則為全球營業額的 3%。下一階段仍在討論如何做到「判斷任意內容是不是 AI 產生」。
  • GDPR:歐盟的個人資料保護法規,陳品諭以它與早期反托拉斯法為例,說明歐盟一貫以高額罰款驅動業者遵循法規。
  • Anthropic 浮水印公告:2026 年 8 月 11 日發布於官方說明文件,適用 8 月 2 日之後推出的模型,出廠即支援、全球適用,涵蓋 Claude、Claude Code、Claude Cowork 與開發者 API。技術規格未公布,偵測工具尚未開放。文件末尾載明兩項限制,見上文第 6 點。

三、相關研究與工具

  • Google 文字浮水印方法:發表於《Nature》,是目前唯一被公開、可供學界檢驗的文字浮水印做法,論文中包含「更動少於 10 個 token 難以移除浮水印」的測試結果。Google 並未公開影像與語音的對應方法。(陳品諭在受訪前回覆本節目時判斷,Anthropic 很有可能沿用 Google 的 SynthID-Text,因為該方法已開源且容易改進;節目中未指名,此為推測。)論文:Dathathri, S.、See, A.、Ghaisas, S. 等,《Scalable watermarking for identifying large language model outputs》,Nature 第 634 期,2024 年,https://doi.org/10.1038/s41586-024-08025-4 開源程式碼:https://github.com/google-deepmind/synthid-text
  • RADAR:陳品諭團隊約三年前提出的 AI 文字偵測器,以對抗式學習訓練,不依賴浮水印,發表於 NeurIPS 2023,於 Hugging Face 累積超過九十萬個下載次數。論文:Hu, X.、Chen, P.-Y.、Ho, T.-Y.,《RADAR: Robust AI-Text Detection via Adversarial Learning》,https://arxiv.org/abs/2307.03838 模型:https://huggingface.co/TrustSafeAI/RADAR-Vicuna-7B(僅供非商業用途) 線上試用:https://huggingface.co/spaces/TrustSafeAI/RADAR-AI-Text-Detector
  • DivEye:陳品諭團隊 2026 年發表於 TMLR 的後續研究,同屬不依賴浮水印的內容偵測路線。論文:Basani, A. R.、Chen, P.-Y.,《Diversity Boosts AI-Generated Text Detection》,https://arxiv.org/abs/2509.18880 程式碼:https://github.com/IBM/diveye 線上試用:https://huggingface.co/spaces/pinyuchen/Diveye_AI_text_detector
  • ImageNet:影像辨識競賽,2012 年至 2016 年間深度學習在此賽事中大幅超越其他機器學習方法,是深度學習成為 AI 代名詞的轉折點,也是陳品諭投入可信任 AI 研究的時代背景。
  • AlphaGo:近代 AI 的第一個重大突破。陳品諭以職業棋手在落敗之後改與 AI 對弈、藉此把棋路想得更遠為例,說明人與 AI 的關係應該是輔助而非取代。



Powered by Firstory Hosting

Podden och tillhörande omslagsbild på den här sidan tillhör 數位時代 Business Next. Innehållet i podden är skapat av 數位時代 Business Next och inte av, eller tillsammans med, Poddtoppen.