時論廣場》打造AI主權 新聞業別沉默(楊方儒)

經歷了搜尋引擎與社群平台20年來的無情宰殺後,全球新聞產業是否又要面對未來20年,人工智慧與LLM大語言模型的持續剝削呢?作為大模型的語料之一,新聞內容顯然已經更加「去識別化」,使用者也不需要擔心語料來源,

時論廣場》打造AI主權 新聞業別沉默(楊方儒)
全球新聞產業是否要面對未來人工智慧與LLM大語言模型的持續剝削呢?圖為AI示意圖。(美聯社)

楊方儒

經歷了搜尋引擎與社群平台20年來的無情宰殺後,全球新聞產業是否又要面對未來20年,人工智慧與LLM大語言模型的持續剝削呢?作為大模型的語料之一,新聞內容顯然已經更加「去識別化」,使用者也不需要擔心語料來源,就按照生成內容照單全收了。

新聞的定義,其實從沒有改變。在大一的新聞學課堂上,符合時效性、重要性、接近性、顯著性、異常性、人情趣味其中一項以上的資訊內容,才是屬於新聞的範疇。好比颱風天各新聞機構採訪所產出的即時內容,滿足了閱聽人所需,也對整體社會的防災與警示效益有著正面貢獻。

只不過,搜尋引擎與社群平台創造的資訊爆炸時代,把傳統新聞機構核心的「編輯價值」,顛覆為科技巨擘打造的「算法價值」,決定閱聽人現在看到什麼與不看什麼。這本質上本來就是互相衝突的,加上他們把8成以上的數位廣告、9成以上的用戶眼球與使用時長全都搶走了,雙方絕對是零和遊戲。

「編輯價值」追求真相,新聞機構過去還要求基層記者要產出有品味的新聞內容,但羶色腥內容顯然更討好算法價值,尤其UGC(用戶生成內容)當道,所有人都可以用毫無門檻的極低成本方式,透過手機即時創造文字與影音了。KOL與網紅如今擁有更高的影響力與信任度,這也高度壓縮了新聞機構身為PGC(專業生成內容)的生存空間,甚至電視新聞頻道與新聞網站,反過來都被海量的「三器」資訊入主了。當然,AIGC(人工智慧生成內容)的時代也已經到來,AI新聞主播與五花八門的生成影片,也都是來取代「工人智慧」的。

對於大語言模型來說,收錄更多高品質的語料,包括權威新聞在內,就能生成更好的分析成效,但是新聞機構都百分百願意嗎?《紐約時報》早在2023年就控告OpenAI與微軟未經授權,使用數百萬篇《紐時》文章來訓練大語言模型,最近還進一步指控OpenAI阻撓交出使用受版權保護新聞內容的資料集與內部紀錄。

至於Anthropic面對作家集體訴訟,直接收錄50萬本從盜版圖書館下載的書籍語料後,已經同意支付15億美元和解金,平均每本作品約可獲得3000美元的回饋,但不包含未來訓練大語言模型的授權。

反過來說,哪一家台灣新聞機構與著作權人,目前已經跟OpenAI與Anthropic簽署授權了呢?台灣官民開發的繁體中文大語言模型與「主權AI」(Sovereign AI),肯定也要收錄本地新聞語料進行訓練,來打造台灣社會的「AI主權」(AI Power),但總是被白嫖的本土新聞機構現在也沒有位子,將更進一步失去新聞江山。

複製貼上過去跨境網路霸權的避稅成功模式,OpenAI與Anthropic在台灣也不設分公司與辦公室,台灣政府就管不到與罰不到他們了。我們毫不設防的網路治理模式,真的有助於「AI主權」的發展嗎?政府真能要求大家都在使用的主流大語言模型,必須要在台灣境內的算力中心運作嗎?主流大語言模型也廣泛收錄簡體中文語料,產出內容都會認同台灣社會的中心思想嗎?

數位發展部投入的「台灣主權AI訓練語料庫」,目前已經收錄了政府擁有著作權的所有文獻與資訊,也免費提供給本土與境外大語言模型收錄,但資料量僅有14.6億個Tokens,相對來說規模很小且八股!就連專擅台灣價值的新聞機構們,還有中央社與公廣集團,都不想免費輸出,迄今尚未授權數位發展部收錄。

過去20年,台灣新聞機構產出的內容都在服務搜尋引擎與社群平台,還要按照他們的遊戲規則,去開設粉專或官方帳號,獲得流量以把高成本製作的新聞內容傳遞出去。現在陷入「沉默螺旋」的新聞機構,則不得不無償貢獻大語言模型,有誰能像《紐約時報》一樣,跨海發聲控告OpenAI與Anthropic?至於9成以上的台灣人不看報紙、9成5以上的台灣人更不看雜誌,從年輕世代都不看新聞開始,這就是消滅新聞機構的完美閉環了。(作者為幣特財經暨鍶科技總編輯)

來源:中時新聞網 https://www.chinatimes.com/opinion/20260714004118-262104