Teken aan

Die impak van data en KI op wetenskaplike produksie

'n Beleidsperspektief oor hoe FAIR-data en KI-beheer wetenskaplike produksie betroubaar kan hou.

Skrywers:

Kopfoto van Barend Mons

Barend Mons, Emeritus Professor van die Universiteit Leiden, Raadslid van die GO FAIR-stigting en Direkteur van LIFES, die Leiden-inisiatief vir FAIR en Billike wetenskap

Kopfoto van Arie Baak

Arie Baak, Raadslid van die LIFES-vereniging vir REGVERDIGE en Billike wetenskap

Kopfoto van Koen Jonkers

Koen Jonkers, Europese Kommissie, Gesamentlike Navorsingsentrum (GNO), Brussel, België

Kunsmatige Intelligensie transformeer hoe wetenskap uitgevoer, gekommunikeer en gevalideer word. Dit hou ware belofte in, wat patroonherkenning moontlik maak op skale wat geen menslike navorser kan ewenaar nie, wat werkvloei versnel en nuwe paaie vir ontdekking oopmaak. Maar KI is ook vinnig, nie foutloos en onoordeelkundig nie, terwyl wetenskap tydrowend en noukeurig van ontwerp is. Die spanning tussen hierdie twee realiteite veroorsaak reeds ernstige disfunksie: 'n vloed van KI-gegenereerde publikasies en data, verswakte portuuroorsig, hallusinasies en geërodeerde vertroue in die wetenskaplike rekord. Die vaardighede wat van toekomstige wetenskaplikes vereis word, verander fundamenteel en wetenskapsbeleid het nie tred gehou nie. Dit is dringend om hierdie gaping aan te spreek.

KI hervorm hoe wetenskap gedoen word

Wetenskap het met merkwaardige spoed van 'n data-arm na 'n data-ryke omgewing beweeg. Waar navorsers eens beskeie datastelle gegenereer en bevindinge hoofsaaklik deur middel van mensleesbare artikels gekommunikeer het, funksioneer hulle nou in 'n era van eksponensiële datagenerering. Baie daarvan is hoogdimensioneel, versprei en slegs deur masjiene hanteerbaar. Hierdie tendens word egter nie in werklike datahergebruik weerspieël nie. Om dit te verander, moet data self nou as 'n eersteklas wetenskaplike uitset behandel word, nie as 'n neweproduk van artikels nie.

Masjiene blink uit in die vind van patrone in groot en komplekse datastelle. Maar masjiene het geen inherente konseptuele model van mens-relevante werklikheid nie. Die resultaat is 'n byna onbeperkte voorraad patrone, baie vals, sommige misleidend. 'n Sentrale uitdaging vir die volgende generasie wetenskaplikes sal wees om deur hierdie patroonoerwoud te navigeer: om betekenisvolle seine van statistiese geraas te onderskei. Menslike toesig is nie opsioneel nie; dit is struktureel noodsaaklik.

Beleidmakers moet ook bewus wees dat KI in wetenskap veel verder strek as Groot Taalmodelle, wat tans die openbare diskoers oorheers. Die breër landskap sluit masjienleer vir hipotesegenerering, outomatiese eksperimentele werkvloeie en kennisgrafiekgebaseerde redenasie in, wat elk afsonderlike risiko's en geleenthede inhou wat pasgemaakte bestuursreaksies vereis.

Datakwaliteit en infrastruktuur is die knelpunt

Die kwaliteit van KI-uitsette in wetenskap word direk bepaal deur die kwaliteit van data. insetteFAIR-data (Vindbaar, Toeganklik, Interoperabel en Herbruikbaar, en toenemend verstaan ​​as Volledig KI-gereed) is die fundamentele voorvereiste vir verantwoordelike KI-gedrewe wetenskap. Daarsonder word KI-modelle opgelei op rou, ongekurateerde, potensieel bevooroordeelde of selfs vervaardigde inhoud, wat hallusinasies veroorsaak wat lewensgevaarlik in kliniese kontekste kan wees en wat stelselmatig vertroue in die wetenskap ondermyn. Veral waar die hergebruik van maklik vindbare data meestal deur nie-wetenskaplik-gebaseerde akteurs soos die huidige LLM-maatskappye plaasvind.

Net so belangrik is die gebruik van FAIR konseptuele modelle om KI te beperk. uitsetteDeur gestruktureerde semantiese raamwerke te verskaf, waar elke konsep goed gedefinieer is, hoe hulle verband hou en wat as geldige afleiding tel, verminder hierdie modelle die risiko van hallusinasies aansienlik en help dit verseker dat KI-gegenereerde bevindinge deur mense verklaarbaar, interpreteerbaar en verifieerbaar bly.

Die integriteitskrisis in wetenskaplike publikasies vererger hierdie risiko's. KI-stelsels kan nou amper onmiddellik geloofwaardige artikels, data en resensies genereer. Een toonaangewende KI-konferensie het in 2025 alleen meer as 20 000 voorleggings ontvang. Die reaksie (wetenskaplikes wat KI gebruik om KI-gegenereerde artikels te hersien) loop die risiko om 'n geslote geraas-terugvoerlus te skep waarin gebrekkige stelsels mekaar evalueer sonder enige betekenisvolle eksterne kontrole. FAIR-data wat by die bron gepubliseer word, waar die oorsprong geverifieer kan word, is een van die mees robuuste gereedskap wat beskikbaar is om hierdie tendens teen te werk.

Onderliggend aan dit alles is 'n strukturele mislukking in aansporingsmaatreëls. Navorsers word steeds hoofsaaklik beloon vir artikeltelling en aanhalingsyfers, 'n maatstaf wat ontwerp is vir 'n data-yl era. Die publikasie van hoëgehalte FAIR-data dra min professionele erkenning en geen gewaarborgde befondsingsdekking nie. Dit moet verander.

Bestuurstekorte is akuut

Die tegniese bestuurslandskap vir data in die wetenskap is in 'n krisis. Dekades van afhanklikheid van 'n klein aantal groot wolkverskaffers, gekombineer met wetlike instrumente soos die Amerikaanse Wolkwet, het 'n data-soewereiniteitsprobleem geskep wat nou akuut is, veral in die lig van onlangse Amerikaanse beleidsonstabiliteit en die uitwerking daarvan op internasionaal gedeelde navorsingsinfrastruktuur. Baie van die wêreld se kern wetenskaplike databronne is effektief buite die jurisdiksionele beheer van die instellings en gemeenskappe wat hulle gegenereer het.

Die FAIR-beginsels, aangevul deur die CARE-beginsels (wat die regte en belange van Inheemse Volke in databestuur aanspreek), bied 'n samehangende raamwerk vir verantwoordelike rentmeesterskap. Saam definieer hulle die voorwaardes waaronder data oop of beperk, herbruikbaar en soewerein moet wees. Die konsep van 'n Internet van FAIR-data en -dienste (IFDS), waarin data by sy bron bly en deur gemagtigde algoritmes besoek word eerder as om gekopieer en gesentraliseer te word, bied 'n praktiese argitektoniese reaksie. In hierdie model reis berekeningsnavrae na verspreide dataknooppunte; data reis nie na gesentraliseerde bewaarplekke tensy dit onvermydelik is nie.

Billike deelname aan KI-gedrewe wetenskap vereis ook dat hierdie infrastruktuur werklik toeganklik moet wees. Instellings en gemeenskappe in die Globale Suide kan nie passiewe onderwerpe van datahergebruik wees nie. Aan die ander kant van die spektrum van konnektiwiteit moet die data-intensiewe nywerheid nie uitgesluit word nie. Verspreide FAIR-infrastruktuur, ontwerp om verskaffersgebondenheid en enkele punte van mislukking te vermy, is die meganisme waardeur betekenisvolle deelname moontlik word.

Wat beleidmakers moet doen

'n Samehangende beleidsreaksie vereis optrede op verskeie fronte:

  • Vereis FAIR-datastandaarde in publiek befondsde navorsing. Befondsingsliggame behoort die publikasie van FAIR-data 'n voorwaarde vir toekennings te maak, nie 'n aanbeveling nie.
  • Befonds data-publikasie en FAIRifikasie as kwalifiserende toelaagkoste. Die belegging wat nodig is om hoëgehalte, masjien-aksie-bare data te genereer, moet erken en gedek word.
  • Hergebruik voorheen gegenereerde data en die ondersteunende infrastruktuur-in aanmerking komende navorsingskoste in toelaagvoorstelleDie belegging wat nodig is om hoëgehalte, masjien-aksie-bare data te stoor en te verskaf, moet erken en gedek word.
  • Ondersteun gemeenskapsgebaseerde standaarde eerder as verskaffergedrewe oplossings. Oop, interoperabele infrastruktuur gebou op minimale gedeelde standaarde verhoed insluiting en verseker 'n gelyke speelveld.
  • Belê in wetenskaplike geletterdheid. Behalwe wetenskaplikes, benodig burgers, joernaliste en beleidmakers ook 'n werkende begrip van KI se vermoëns en beperkings. Die gaping tussen openbare persepsie en tegniese werklikheid is 'n bestuursrisiko.
  • Mandaatvereistes vir herkoms en deursigtigheid vir KI wat in navorsing gebruik word. Enige KI-stelsel wat bydra tot gepubliseerde wetenskaplike bevindinge, moet vereis word om opleidingsdata-oorsprong, modelbeperkings en -tekortkominge bekend te maak.

Wetenskap is 'n globale openbare bate. Die integriteit, billikheid en openheid daarvan kan nie aanvaar word nie; dit vereis aktiewe beleidskeuses. Die venster om gesonde bestuur vir KI in wetenskaplike produksie te vestig, is oop, maar dit sal nie onbepaald so bly nie. Die besluite wat nou geneem word oor datastandaarde, infrastruktuur, aansporings en toesig, sal bepaal of KI betroubare wetenskap versnel of dit sistematies ondermyn.


Foto deur Getty Images vir Unsplash+

Hierdie blog, wat in vennootskap tussen die Internasionale Wetenskapraad (ISC) en Frontiers Policy Labs aangebied word, is deel van die 'n Nuwe bestuur vir wetenskap in die 21ste eeu" reeks wat dien as 'n dinamiese besprekingsforum vir denkleierskap oor die toekoms van wetenskaplike bestuur. Die inisiatief beweeg weg van rigiede akademiese studies en bring toonaangewende globale stemme bymekaar om skerp, uitlokkende, maar bewysgebaseerde en toekomsgerigte meningsstukke te lewer. Deur dit te doen, wil dit bydra tot die definisie van 'n veerkragtige, inklusiewe en deursigtige bestuursmodel wat toegerus is vir die uitdagings van môre.

Sien die oorspronklike pos na hierdie skakel.

Vrywaring
Die inligting, menings en aanbevelings wat in ons gasblogs aangebied word, is dié van die individuele bydraers en weerspieël nie noodwendig die waardes en oortuigings van die Internasionale Wetenskapraad nie.

Bly op hoogte met ons nuusbriewe