Tehnologie. Digital. Inovație.
Ai

China se confruntă cu o gravă lipsă de date de pregătire pentru AI de înaltă calitate

Severe Shortage: China’s ambitious artificial intelligence sector is hitting a major wall that has nothing to do with hardware or semiconductors

China se confruntă cu o gravă lipsă de date de pregătire pentru AI de înaltă calitate

Editorii tradiționali resping datele AI?

În lipsa unor seturi de date variate și fiabile, aceste modele nu pot atinge nivelul de raționament sau precizia omologilor lor occidentali.

Platformele majore, precum WeChat și Weiyin, funcționează ca ecosisteme închise care limitează accesul la interacțiunile utilizatorilor, cu excepția unor corporații publice mai mici care își partajează rar informațiile.

Această disparitate masivă creează un dezavantaj semnificativ pentru dezvoltatorii care încearcă să construiască sisteme AI sofisticate, limitările privind accesul la datele digitale rămânând, astfel, o problemă majoră pentru aceșt

Poate China să depășească limitările datelor în cursa pentru AI?

Sectorul de inteligență artificială ambițios al Chinei lovește un zid important care nu are nimic de-a face cu hardware sau semiconductori. În timp ce engleza domină internetul global, reprezentând aproape jumătate din tot conținutul web, materialul în limba chineză reprezintă doar 1,3%. Experții din industrie raportează o lipsă critică de date de pregătire în limba chineză de înaltă calitate. Acest gât de gălăgie amenință să încetinească dezvoltarea unor modele avansate de limbă mare pe măsură ce firmele interne se luptă să găsească informații suficiente.

Mai mult, peisajul juridic se schimbă pe măsură ce editorii tradiționali încep să respingă. Poate Beijing să pună la punct de golul datelor

Multe organizații media și creatori de conținut pun în aplicare acum interdicții stricte asupra scraping-ului AI.

Aceste entități sunt din ce în ce mai protectoare față de proprietatea intelectuală, temând că gigantii tehnici vor folosi munca lor pentru a instrui modele fără a oferi o compensație sau credit echitabil.

Pot fi aceste modele AI cu adevărat performante fără acces la date?

Guvernul a recunoscut gravitatea acestei crize și ia măsuri active pentru a interveni. Beijingul a anunțat recent un plan ambițios de a stabili seturi de date naționale masive, standardizate până în 2028. Internetul conține foarte puțin text chinezesc de înaltă calitate în comparație cu limba engleză. De ce nu există suficiente date de pregătire în prezent?

Cele mai multe date disponibile sunt blocate în cadrul platformelor private care refuză să le împărtășească. Beijingul își propune să creeze seturi de date naționale mari, susținute de guvern până în 2028.

Ce face guvernul pentru a remedia deficitul?

More stories:

Content written by Radu Constantin for stiri-blockchain.ro editorial team, AI-assisted.

Share:

Leave a comment