摘要重點
隨著AI已從聊天機器人發展到自主數位員工,獲美國科技巨頭OpenAI和Anthropic青睞的AI數據供應商Mercor,近期業務範圍現已從公開的網路內容,擴展到企業內部最私密的通訊記錄。
最近一例是,AI代理商新創公司Warmly今年6月下旬宣布將被HubSpot收購,僅僅8天後,Warmly創辦人兼執行長格林沃德(Max Greenwald)就收到Mercor的電子郵件,對方尋求購買或獲授權Warmly的內部資料,包括Slack聊天記錄、GitHub記錄、Asana專案管理內容、Google Drive文件以及員工會議記錄。Mercor的出價為30萬美元(約957萬台幣)。
接下來數天,Warmly又收到多個來自Mercor和其他AI數據公司的類似詢價,但格林沃德最終全部拒絕。
AI數據公司購買書籍和新創公司程式碼早已不是什麼新鮮事,但隨著AI巨頭加速開發自主AI代理,數據需求本質正在發生根本性的轉變。公共網路內容、書籍和程式碼,已不足以滿足下一代AI模型的訓練需求。
數據公司Protege執行長山繆(Bobby Samuels)指出,AI實驗室實際上已經「抓取整個網路」,而他們現在真正需要的是人與人之間的真實互動。 Protege主要協助企業評估其內部資料是否符合出售或授權的條件。光是今年,該公司就處理至少1億美元(約31.9億台幣)的數據交易,比去年同期約3000萬美元(約9.57億台幣)增加3倍多。
🔗 延伸閱讀《AI數據標註新創公司Mercor獲新一輪融資 估值衝上3000億》
🔗 延伸閱讀《矽谷Mercor聘失業記者、學者訓練AI 白領感嘆:親手教AI怎麼取代我》
聊天記錄為何變得如此有價值?
當AI從只能回答問題的聊天機器人轉型為能夠真正分擔工作量的數位員工時,需要的遠不止「答案是什麼」,它需要理解「人類實際上是如何完成工作的」。
例如:員工如何回應客戶提出的問題;工程師如何逐步排除IT系統故障;財務人員如何處理發票差異;銷售人員如何在CRM系統中更新客戶記錄。甚至包括軟體突然報錯時員工的具體點擊和輸入操作。這些真實的工作經驗幾乎無法在公共網路上找到。
IT工單可能記錄「員工無法登入網站」,隨後是Slack聊天記錄,顯示工程師們討論根本原因,包含最終解決方案的電子郵件,以及記錄相關程式碼修復的GitHub提交記錄。對人類而言,這只是例行故障排除。
但對AI代理(AI agent)來說,這是一整套極具價值的「在職訓練」,正是訓練能夠自主執行任務的AI系統所需素材。
隱私權與智慧財產權的灰色地帶
然而這塊新興產業其實很複雜,尤其是隱私和智慧財產權的棘手問題。
Slack對話可能包含客戶訊息、電子郵件可能包含員工姓名、會議記錄可能洩露商業機密,而醫療保健公司的資料甚至可能涉及病患隱私。所有此類數據在合法出售或授權給AI公司之前,都必須進行匿名化處理。
Warmly執行長格林沃德拒絕出售內部資料的決定,就反映出部分創業家對這類交易的保留。即使公司即將被收購或已關閉,內部通訊記錄仍可能涉及員工、客戶和合作夥伴的隱私。


