AI 連男女講話都要評分?我覺得這件事從根本上就搞錯了

AI 連男女講話都要評分?我覺得這件事從根本上就搞錯了

最近看到一篇研究報導,說美國約翰霍普金斯大學做了一項實驗,發現當使用者用比較「女性化」的語氣跟 AI 說話——比如語氣比較柔和、帶有情感、或是用比較迂迴的方式表達需求——那四個主流 AI 模型給出的回答,品質都會下降。更直白地說,AI 會認為那種講話方式「比較不專業」、「比較情緒化」,然後它自己的回應也跟著變弱。

我讀完之後,心裡有一個很奇怪的感覺。

不是憤怒,也不完全是驚訝。是一種……困惑。一種「你們為什麼要這樣設計問題」的困惑。

為什麼性別在這裡突然變得很重要?

研究本身我不懷疑,實驗設計聽起來也是嚴謹的。但我讀著讀著就一直在想:為什麼這個時候性別要成為一個分類框架?我們現在在討論的,到底是「AI 有性別偏見」,還是「AI 根本不懂人在溝通時想達到什麼目的」?

這兩件事聽起來像是同一件事,但我覺得差很遠。

前者讓我們把問題框在性別歧視上,後者讓我們看到的是一個更根本的結構性問題:AI 這個東西,從頭到尾都是用邏輯建起來的。它能處理的,是有辦法被轉換成邏輯的事情。那些沒辦法被轉換成邏輯的溝通目的,它從一開始就沒有辦法真的理解。

不管那個溝通目的是來自男性還是女性。

AI 沒有資格做這個判斷

我說的「沒有資格」,不是一種情緒上的指責,而是一種能力上的事實陳述。

你讓 AI 去判定一段話是不是夠專業、是不是夠有邏輯,它當然可以做。因為「邏輯」本來就是它的母語。但你讓它去理解「這個人說這句話的目的是什麼」——如果那個目的是建立信任感、是讓對方感覺被看見、是在不直接衝突的前提下傳達一個訊息——那它真的沒有辦法。

不是因為它偏心,是因為那不在它能處理的範疇裡。

女性在對話中很多時候的目的,本來就不是為了建立一個邏輯嚴密的論述。那不是缺點,那是一種完全不同的溝通邏輯——或者說,他們溝通的主軸實際上是陪伴。你用一個邏輯機器去評判它,得到的結論當然會是「這不夠好」,但那只是因為你用錯了標準。

就好像你找一個籃球比賽的裁判,去給一場鋼琴獨奏會評分。他不是壞人,他可能是一個非常優秀的籃球裁判,但他給出的「評分」對音樂這件事來說毫無意義。因為他的整套專業,根本就不是為了判斷這個而存在的。

我們實際在外銷業務上碰到的,是類似的問題

跑外銷這幾年,我常常碰到一件事:不同國家的客戶,他們在信件或會議裡傳達訊息的方式差異非常大。日本客戶可能說「這部分我們需要再確認一下」,意思可能是「這我們不能接受」。中東客戶可能語氣非常熱情、大量讚美,但那不代表他們已經決定要跟你合作。

如果你讓 AI 去分析這些往來信件的「邏輯結構」,它可能會告訴你:對方語意模糊、意圖不明確、需要更直接的回覆。

但實際上,那些「模糊」和「迂迴」本身就是訊息。你不能把它們過濾掉,因為它們是對話真正的內容。

這跟那個研究發現的問題,根本上是同一件事。AI 看到的是語言的表層結構,它看不到那個結構背後,人為什麼要用那種方式說話。

我們有沒有在用錯工具解決問題?

我後來想,也許這個研究最值得討論的地方,不是「AI 對女性有偏見」,而是「我們一直在把 AI 放到它不適合的位置上」。

我不是說 AI 沒有用。它在很多地方確實省了大量的時間,在整理資料、翻譯文件、生成初稿這些事情上,它是很好的工具。但當我們開始把它當成一個「判斷人的溝通品質」的評審,當我們開始依賴它來告訴我們一段話「夠不夠好」——那我覺得我們需要停下來問自己:「好」是對什麼來說夠好?

如果那段話的目的是建立一段信任關係,AI 給你的「不夠專業」評語,可能是完全錯的。

工具要放對位置,這是很基本的事

在我自己的業務裡,我一直有一個原則:不是所有東西都要自動化,不是所有判斷都要交給系統。某些事情是需要人去感受的,客戶在說什麼、他為什麼這樣說、他真正想要的是什麼——這些事情,我不會全部外包給 AI。

那個約翰霍普金斯的研究,讓我更確定這個原則是對的。

AI 的邏輯能力是真實的,它的限制也是真實的。問題從來不是 AI 夠不夠厲害,問題是我們有沒有搞清楚,我們要解決的問題,本來是不是它能解決的那種問題。

找對的人做對的事,工具也一樣。這件事聽起來很簡單,但在 AI 工具這麼方便、這麼無所不在的現在,反而是最容易被忘掉的事情。

───

Inspired by: 四大主流模型全中招,最新研究:AI 判定女性化用語較不專業且充滿誇張情緒

───

這篇文章的內容組成:人 AI 共同創作

人類觀點 55% | 新聞脈絡 18% | AI 補充 27%

了解我們如何計算這個比例 →

分享:
這個問題你正在面對嗎?
預約 20 分鐘,用你的實際資料走一遍——不用準備任何東西。
預約諮詢 →
← 回到部落格