Wikipedia lager datasett for å bekjempe AI Bot overvelde

Wikipedia lager datasett for å bekjempe AI Bot overvelde

Wikimedia Foundation samarbeider med Kaggle for å gi ut AI-optimalisert Wikipedia datasett

Onsdag, Wikimedia Foundation kunngjort Dets partnerskap med Google-eide Kaggle, en ledende plattform for datavitenskapssamarbeid, for å lansere en kuratert versjon av Wikipedia optimalisert spesielt for AI-modellopplæring. Opprinnelig fokuserer denne bestrebelsen på engelsk og fransk, og gir strømlinjeformet, rå tekst av Wikipedia -artikler uten noen markdown eller referanseelementer.

Wikipedia: En non-profit ressurs for AI Innovation

Som en frivilligdrevet, non-profit plattform, er Wikipedia først og fremst avhengig av donasjoner for finansiering og krever ikke eierskap over innholdet det er vert. Denne unike strukturen tillater ubegrenset bruk og remixing av dets omfattende kunnskapsbase, og fremmer initiativer som Kiwixen offline versjon av Wikipedia utnyttet for å spre avgjørende informasjon i regioner som Nord -Korea.

Adresserer ikke-menneskelig trafikk og båndbreddekrav

Likevel har en betydelig bølge i roboter kontinuerlig å krype sidene for AI-trening ført til en dramatisk økning i ikke-menneskelig trafikk til Wikipedia, et spørsmål stiftelsen tar sikte på å avbøte på grunn av stigende driftskostnader. Tidligere denne måneden rapporterte stiftelsen en 50% økning I båndbreddeforbruk siden januar 2024. Ved å tilby en standard, JSON-formatert datasett, håper Wikimedia Foundation å avskrekke AI-utviklere fra å overbelaste serverne.

Kaggle: En katalysator for tilgjengelig AI -data

Brenda Flynn, Kaggle’s Partnerships Lead, uttrykte entusiasme for initiativet, og sa: «Som det stedet Machine Learning Community kommer for verktøy og tester, er Kaggle ekstremt spent på å være verten for Wikimedia Foundations data. Kaggle er glade for å spille en rolle i å holde disse dataene tilgjengelige, tilgjengelige og nyttige,» I følge The Verge.

Den etiske debatten rundt AI -treningsdata

Teknologibransjen har lenge kjempet med implikasjonene av å bruke innhold som er opprettet av andre for å trene AI. Det er et økende følelse av at alt innhold skal være fritt tilgjengelig, med noen som hevder at bruk av online materialer for AI -trening utgjør rettferdig bruk på grunn av det transformative potensialet til AI -modeller. Imidlertid er det avgjørende å huske at originale innholdsskapere pådrar seg kostnader og krefter for å produsere arbeidet sitt.

Mange AI -oppstarter har sett bort fra de etablerte normene, som begrenser den automatiserte skrapingen av nettstedinnhold. Språkmodeller, som genererer menneskelignende tekst, krever omfattende datasett for å utvikle seg effektivt, noe som fører til en voldsom konkurranse om treningsmateriell av høy kvalitet, sammenlignbar med verdien av olje under AI-revolusjonen. Store modeller blir ofte opplært på Opphavsrettsbeskyttede verkog mange AI -selskaper er involvert i pågående rettssaker om denne praksis. Risikoen for selskaper som Chegg og Stack Overflow er at AI -firmaer kan utnytte innholdet uten å lede noen netttrafikk tilbake til kilden.

The Creative Commons License: Balancing Access and Rights

Mens noen Wikipedia -bidragsytere kan motstå bidragene deres som brukes til AI -trening, er det viktig å erkjenne at alt innhold er gitt under Creative Commons Attribution-Sharealike License. Denne lisensen gjør det mulig for noen å Del, tilpasser og bygger på verk, selv for kommersielle formål, så lenge den opprinnelige skaperen er kreditert og derivatverk er lisensiert på samme måte.

Gratis tilgang til Wikipedia’s AI -datasett på Kaggle

Datasettet som er vert på Kaggle er tilgjengelig for utviklere uten kostnad. Wikimedia Foundation avslørte overfor Gizmodo at Kaggle bruker Wikipedia’s datasett gjennom et beta-program for «strukturert innhold» i Wikipedia Enterprise Suite-et premium-tilbud for brukere av høyt volum til å lette innholdsbruk. Stiftelsen understreker at all gjenbruk av dette innholdet fra AI -modellutviklere må overholde Wikipedias attribusjons- og lisensbehov.

FAQ: Forstå Wikipedia og Kaggle Partnership

Hva er formålet med Kaggle og Wikimedia -partnerskapet?

Partnerskapet tar sikte på å lage en raffinert versjon av Wikipedias tekstdata som er spesielt designet for å hjelpe utviklere i å trene AI -modeller, og forbedre tilgjengeligheten mens de tar opp båndbreddeproblemer relatert til AI -trafikk.

Hvordan kan utviklere få tilgang til Wikipedia -datasettet på Kaggle?

Utviklere kan få tilgang til datasettet gratis på Kaggle. Det er strukturert for enkel integrasjon i maskinlæringsprosjekter og er tilgjengelig gjennom et beta-program rettet mot brukere med høyt volum.

Hvilken lisensiering styrer innholdet som er tilgjengelig på Wikipedia?

Alt innhold på Wikipedia er lisensiert under Creative Commons Attribution-Sharealike-lisensen, noe som gir mulighet for gratis deling og tilpasning, forutsatt at de opprinnelige skaperne er kreditert og at derivatverk er lisensiert på samme måte.

Hvorfor er båndbreddestyring viktig for Wikipedia?

Den betydelige økningen i AI -roboter som får tilgang til Wikipedia har forårsaket en bølge i båndbreddeforbruk, noe som øker driftskostnadene for stiftelsen. Ved å tilby et optimalisert datasett tar stiftelsen som mål å dempe disse problemene.

Støtt vårt arbeid ❤️

Hvis du likte denne artikkelen, vurder å gi en tips for å hjelpe oss med å fortsette å publisere kvalitetsinnhold.

Sikker betaling med PayPal