加快建立人工智能訓(xùn)練數(shù)據(jù)合理使用制度
文 | 孫曉麒 中國政法大學(xué)刑民交叉研究中心特約研究員,鄧宏光 西南政法大學(xué)民商法學(xué)院教授、博士生導(dǎo)師
近日,中央網(wǎng)信辦印發(fā)通知,在全國范圍內(nèi)部署開展為期4個月的“清朗·整治AI應(yīng)用亂象”專項行動。該行動第一階段重點整治的問題中就包括大模型訓(xùn)練語料安全,如訓(xùn)練語料審核把關(guān)不嚴(yán),模型訓(xùn)練數(shù)據(jù)存在違法不良信息;訓(xùn)練數(shù)據(jù)來源合規(guī)性存在問題,模型訓(xùn)練過程中使用未經(jīng)授權(quán)的文字、圖片、音視頻等數(shù)據(jù),明確強化AI技術(shù)源頭治理。
回溯人工智能的發(fā)展歷程,從最初的文本生成,到如今的圖像、音樂、視頻等多模態(tài)內(nèi)容生成,每向前邁進一步,對訓(xùn)練數(shù)據(jù)的廣度、深度和復(fù)雜性的要求就更高一層。可以說,沒有數(shù)據(jù),就沒有模型;沒有高質(zhì)量數(shù)據(jù),就沒有高水平模型。今天的大模型競爭,表面上看是算法與算力的競爭,實則是數(shù)據(jù)供給與數(shù)據(jù)治理能力的競爭。誰能在合法合規(guī)的前提下穩(wěn)定獲得可用數(shù)據(jù),建設(shè)高質(zhì)量語料和數(shù)據(jù)集,誰就能在未來的人工智能競爭中占據(jù)主動甚至主導(dǎo)地位。
當(dāng)前,針對人工智能訓(xùn)練數(shù)據(jù)的使用,尚缺乏統(tǒng)一的制度規(guī)則。實踐中主要依靠《生成式人工智能服務(wù)管理暫行辦法》《中共中央 國務(wù)院關(guān)于構(gòu)建數(shù)據(jù)基礎(chǔ)制度更好發(fā)揮數(shù)據(jù)要素作用的意見》等規(guī)范,再輔之以著作權(quán)法中合理使用制度等相關(guān)規(guī)則加以調(diào)節(jié)。在整體上,仍須完善與其他各部門法協(xié)調(diào)統(tǒng)一、內(nèi)容明確、具有直接針對性的制度規(guī)范。由于現(xiàn)實中的模型訓(xùn)練數(shù)據(jù)往往來源復(fù)雜、層級多樣、流轉(zhuǎn)頻繁,使得大量數(shù)據(jù)處于權(quán)屬不明、授權(quán)不清、來源難溯的狀態(tài)。加之算法訓(xùn)練過程高度復(fù)雜,模型機制帶有明顯的“黑箱”屬性,進一步導(dǎo)致權(quán)利識別難、侵權(quán)舉證難、責(zé)任劃分難,成為實踐中普遍存在的現(xiàn)實問題。鑒于此,建立人工智能訓(xùn)練數(shù)據(jù)合理使用的制度規(guī)則可謂迫在眉睫。訓(xùn)練數(shù)據(jù)治理不能只依賴事后個案裁判,還應(yīng)建立分類分級、授權(quán)留痕、來源可溯、風(fēng)險評估和爭議救濟等制度機制。尤其要區(qū)分訓(xùn)練階段的數(shù)據(jù)攝取、模型輸出階段的內(nèi)容生成,以及平臺傳播階段的責(zé)任承擔(dān),避免將不同環(huán)節(jié)的法律責(zé)任簡單混同。
事實上,“十五五”規(guī)劃綱要已對此作出針對性部署,提出“完善數(shù)據(jù)標(biāo)準(zhǔn)體系和質(zhì)量管理體系,加快建設(shè)人工智能語料庫,面向能源、交通、制造、教育、健康、金融等領(lǐng)域建設(shè)高質(zhì)量數(shù)據(jù)集,建立人工智能訓(xùn)練數(shù)據(jù)合理使用制度”。這意味著訓(xùn)練數(shù)據(jù)治理已不只是技術(shù)企業(yè)自身的合規(guī)問題,而是關(guān)系數(shù)據(jù)資源開發(fā)、人工智能產(chǎn)業(yè)競爭力和數(shù)字中國建設(shè)全局的基礎(chǔ)性制度問題。構(gòu)建科學(xué)有效的制度規(guī)則是人工智能行穩(wěn)致遠(yuǎn)的重要保障。讓人工智能訓(xùn)練數(shù)據(jù)合理使用制度立得住、行得通,兩方面的問題尤其值得關(guān)注。
一方面,應(yīng)統(tǒng)籌好多元關(guān)系。人工智能訓(xùn)練數(shù)據(jù)從生成、處理、流通到進入模型訓(xùn)練,涉及原始權(quán)利人、數(shù)據(jù)處理者、交易平臺、模型開發(fā)者、應(yīng)用企業(yè)和最終用戶等多類主體。制度設(shè)計既不能把數(shù)據(jù)資源簡單視為可任意抓取的公共素材,也不能因權(quán)利邊界不清而使創(chuàng)新活動陷入過度不確定。關(guān)鍵在于建立清晰、可操作、可預(yù)期的規(guī)則:對可自由使用、需授權(quán)使用、限制使用和禁止使用的數(shù)據(jù)作出分類安排,對授權(quán)、收益分配、來源追溯和責(zé)任承擔(dān)形成明確機制。
另一方面,人工智能訓(xùn)練數(shù)據(jù)使用天然具有跨境性,涉及版權(quán)例外、文本與數(shù)據(jù)挖掘、跨境數(shù)據(jù)流動、數(shù)字貿(mào)易和平臺治理等多重議題。這要求我們在制度制定中,既要立足國內(nèi)產(chǎn)業(yè)實踐,也要重視與國際通行規(guī)則的兼容、對話和轉(zhuǎn)化。尤其在相關(guān)國際規(guī)則仍處于形成和調(diào)整階段的背景下,應(yīng)通過知識產(chǎn)權(quán)、數(shù)字經(jīng)濟和人工智能治理等多邊平臺,積極提出具有實踐基礎(chǔ)、制度解釋力的中國方案。
面向人工智能快速發(fā)展的新階段,我們應(yīng)以訓(xùn)練數(shù)據(jù)合理使用制度建設(shè)為重要抓手,加快推動形成分類清晰、授權(quán)明確、流通有序、責(zé)任可追的治理體系,在保護權(quán)利人合法權(quán)益的同時釋放數(shù)據(jù)要素價值,在規(guī)范市場秩序的同時激發(fā)技術(shù)創(chuàng)新活力。唯有如此,人工智能產(chǎn)業(yè)才能在法治軌道上行穩(wěn)致遠(yuǎn),我們也才能在全球人工智能治理規(guī)則塑造中貢獻更多“中國智慧”。









