智慧農業須以高質量數據集為支撐
文 | 梁偉亮 中國農業大學農業與農村法制研究中心研究員、人文與發展學院副教授
近期,國務院印發《加快農業農村現代化“十五五”規劃》。此次規劃將“推進人工智能運用和智慧農業發展”作為重要部署,為智慧農業發展指明了方向。農業是最需要數字技術賦能,也最能體現人工智能價值的領域之一。但“人工智能+農業”的發展,不只在于智能裝備和算法模型,更在于穩定、豐富、可信的數據供給。
近日,國家數據局發布《關于推進行業高質量數據集建設行動的實施方案》,進一步把高質量數據集建設擺在基礎性位置。行業高質量數據集是經過采集、加工等處理,可直接用于開發和訓練人工智能模型、能夠有效提升模型性能的行業數據集合,是推動“人工智能+”賦能千行百業、實現產業落地的基礎性、關鍵性資源。實施方案圍繞行業高質量數據集供給、流通、應用等關鍵環節,推動形成“場景牽引數據、數據驅動模型、模型賦能應用、應用創造價值”的良性循環。對農業而言,這一循環能否轉起來,關鍵就在于能否把散落在生產一線、科研平臺、經營主體和公共服務系統中的數據組織起來、治理起來、利用起來。
當前,從耕地保護、農情監測、病蟲害識別,到智能農機、智慧灌溉、良種選育,農業生產的各個環節都在持續產生數據。這些數據雖然分散,卻蘊含著土壤、氣候、作物、農機、經營主體和市場需求之間的復雜聯系。實踐中,“神農”“司農”等農業大模型不斷涌現,遙感影像、作物長勢、病蟲害識別、農機作業、氣象環境、種質資源等數據加速匯集,為農業智能化發展作出積極貢獻。但也要看到,農業數據來源廣、類型多、產出主體分散,采集標準不一、標注質量不齊、流通渠道不暢等問題仍然存在,真正能夠穩定用于模型訓練的高質量數據仍顯不足。
因此,推動“人工智能+農業”發展,不能把著力點停留在“建幾個模型、上幾個平臺”上。農業大模型要真正服務生產,必須以高質量數據集為支撐,把農業經驗、農學知識、生產記錄、遙感影像、農機軌跡、氣象環境等轉化為可計算、可訓練、可驗證的數據資源。只有數據供得出、流得動、用得好、保安全,人工智能才能真正管用。
高質量數據集建設,首先要解決數據供給的問題。農業數據無法憑空產生,需要從生產實踐中來,需要多方主體共同貢獻。要讓各類主體愿意供給、放心供給,就必須讓貢獻有回報、權益有保障。對于凝結著農戶、集體經濟組織和其他農業經營主體勞動投入的數據,應當建立更加清晰的權益確認和收益分享機制,避免“數據被拿走、收益留不下”的問題。只有讓數據貢獻者看得見收益、摸得著保障,才能讓農業數據“從沉睡中醒來”。
高質量數據集建設,還要解決數據質量的問題。農業大模型不同于一般問答模型,它面對的是復雜多變的自然條件和高度專業的農業知識。病蟲害識別需要準確圖片和專家標注,土壤肥力判斷需要長期監測和區域經驗,育種模型還涉及基因、性狀、環境等多維數據。如果數據不完整、不準確、不及時,模型輸出就可能失真,甚至誤導農業生產。因此,要把質量意識貫穿數據采集、清洗、標注、更新、反饋全過程,推動農業專家、技術人員和智能工具協同參與,形成“數據—模型—應用—反饋”的良性循環。模型用得越多,數據越能不斷校準;數據越優,模型越能精準服務。
高質量數據集建設,更要解決數據安全保障的問題。農業數據關系糧食安全、生態安全、生物安全和農民權益,不能簡單地一放了之。需要根據數據內容、敏感程度、應用場景和公共價值實行差別化管理。對基礎性、公益性強且風險較低的數據,可以積極開放共享;對涉及敏感區域、個人信息、商業秘密和重要資源的數據,則要設置必要條件,明確用途范圍和責任。安全不是發展的對立面,而是數據長期流通、持續利用的前提。守住安全底線,才能形成可持續的數據供給秩序。
面向未來,應以農業真實需求為牽引,以數據質量提升為核心,以多方參與和利益共享為支撐,推動更多農業數據從田間地頭走向模型訓練、從分散沉淀走向融合利用。當高質量數據源源不斷匯入農業大模型,人工智能就能更好地服務糧食穩產增產、農民增收致富、鄉村全面振興。把高質量數據集建設好、利用好、保護好,必將為“人工智能+農業”注入更加澎湃的動力,也將為農業強國建設開辟更加廣闊的空間。









