Hizkuntzaren prozesamendu

| Artikulu hau hobetzeko lanean ari da wikilari bat. Hori dela eta, beharbada hutsuneren batzuk izango dira edukian edo formatuan. Mesedez, aldaketa handi bat egin baino lehen, eztabaida ezazu haren lankide orrian edo artikuluaren eztabaida orrian, erredakzioa koordinatzeko. |
Hizkuntzaren prozesamendua (ingelesez, NLP - Natural Language Processing edo Computational Linguistics) informatika, adimen artifizial eta hizkuntzalaritzaren alorra da, hizkuntzalaritza konputazionaleko ingeniaritza lantzen duena. Hizkuntzaren bidez pertsona eta makinen arteko komunikazioa, baita pertsonen artekoa ere, errazteko tresna konputazionalak ikertzeaz arduratzen da.
Hizkuntzaren prozesamendua izenarekin ezagutzen dugunari hizkuntzalaritza konputazionala ere esaten zaio askotan, hitz biak ia sinonimotzat har daitezke. Batzuetan hizkuntzalaritza konputazionala terminoa lehenesten da hizkuntzalaritzaren ikuspuntua azpimarratzeko, eta hizkuntzaren prozesamendua, aldiz, ikuspuntu teknologikoa azpimarratzeko, baina bereizketa hori ez da zurruna. Bestalde, Ingelesezko Wikipedian Computational_linguistics (Hizkuntzalaritza Konputazionala) kategoriaren barruan Natural Language Processing (Hizkuntzaren prozesamendua) eta Speech Recognition (Hizketaren tratamendua) kategoriak bereizten dira, nonbait hizkuntzaren prozesamendua hizkuntza idatziarekin lotuz, eta hizketaren tratamendua ahozkoarekin, baina gero erabilera mailan Computational linguistics eta Natural Language Processing kontzeptuen arteko bereizketa hori ez dago hain garbi. Euskaraz Hizkuntza naturalaren prozesamendua edota Lengoaia naturalaren prozesamendua ere erabili izan dira aurreko urteetan, baina joera dago azken bi izen horiek baztertzeko, eta hizkuntzaren prozesamenduaren erabilera lehenesteko.
| « | Hizkuntza berez datorkigun zerbait dela uste dugu, eta erraz sortzen dugula, arnasa hartzea edo oinez ibiltzea bezala. Baina dirudiena baino askoz eragiketa konplexuagoa da hitz egitea. Hitz egiten ari garenean, adierazi nahi ditugun esanahiak hizkuntza-forma bihurtzen ditugu, eta hizkuntza-forma horiek soinu/irudien bidez igortzen ditugu. Era berean, hizkuntza hori ulertzeko, gure begi/belarriek seinale bat dekodifikatu behar dute lehenengo, horri dagokion hizkuntza-forma aurkitu eta hizkuntza-forma horrek daraman esanahia jaso. Hori guztia burmuinak egiten du, baina prozesu horretan eragin handia daukate beste hamaika faktorek. | » |
Aplikazioak
[aldatu | aldatu iturburu kodea]Gaur egun badira testua edo hizketa lantzeko zenbait hizkuntza–aplikazio eskuragarri, hala nola:
- Ortografia-zuzentzaileak.
- Estilo-zuzentzaileak.
- Lexikografia konputazionala. Hiztegiak sortzeko eta kontsultatzeko..
- Morfologia konputazionala.
- Itzulpengintza automatikoa, eta itzulpen-laguntzak.
- Hizketa-ezagutzaileak. Hizketa-soinua testua bihurtzen duten sistemak. (ASR, Automatic Speech Recognition). Hitz egiten duen pertsona baten edo batzuen soinu hotsa entzunda, zehaztea hitzaldiaren irudikapen testuala da hizketa-ezagutza. Hori testuaren eta diskurtsoaren kontrakoa da, eta arazo izugarri zaila da. Hizketa naturalean ia ez dago etenik hurrenez hurreneko hitzen artean, eta, beraz, hizketaren segmentazioa ezinbesteko azpi-eginkizuna da berbaldia ezagutzeko. Hizkuntza gehienetan, hurrenez hurreneko letrak irudikatzen dituzten soinuak koartikulazio izeneko prozesu batean nahasten dira, eta, beraz, seinale analogikoa ezaugarri diskretu bihurtzea oso prozesu zaila izan daiteke. Era berean, hizkuntza bereko hitzak azentu desberdineko pertsonek esaten dituztenez, hizkuntza prozesatzeko softwareak sarrerako barietate zabala bata bestearen berdina dela aitortzeko gai izan behar du.
- Ahotsaren sintesia. (TTS, Text To Speech).
- Informazioaren berreskurapena, Dokumentu-bilatzaileak (IR, Information Retrieval).
- Karaktereen ezagutze optikoa (edo Optical Character Recognition, OCR). Testuak daukan argazki bat emanez gero, dagokion testua zehaztea.
- Galdera-erantzun sistemak. Galderetarako erantzunak bilatzeko sistemak (QA, Question Answering).
- Informazio-erauzketa. Datuak erauztea dokumentuetatik (IE, Information Extraction).
- Ikasketa automatikoa
- Testu-meatzea (text mining). Informatikaren munduan azken urteetan indarra hartu duen arloa dugu data mining edo text mining izenekoa. Datu-masa handietatik ondorioak ateratzea da funtsa, eta aplikazio asko du: maileguen arriskuak, gaixotasunen arrisku-taldeak... Datu horiek testuak direnean text mining terminoa erabiltzen da, datuak orokorrean Internetetik hartzen direnean, aldiz, web mining. Guzti horietan erabiltzen diren metodoak antzekoak dira, baina testuekin arazo bat dago: ezaugarriak edo adierazleak asko dira eta ez daude agerian. Medikuntzan edo finantzatan ezaugarri argiak daude, diru-mugimenduak esaterako, eta gehienetan jasota. Text mining eta informazio erauzketa automatikoa sinonimotzat har daitezke.
- Entitate Izendunen miaketa (edo Named Entity Recognition ingelesez, NER). Testu bat emanda, bere izen propioen azterketan eta horien iturria bilatzean datza, hala nola, pertsonak edo lekuak. Kapitalizazioak lagundu dezakeen arren (adibidez, “Azkoitia” lekua letra larriz hasten da), informazio honek ezin du lagundu entitate mota zehazten; edonola ere, askotan ez da zehatza edo ez da nahikoa. Adibidez, esaldi baten lehen letra ere letra larriz idatzita dago, eta izaki izenek sarritan hitz batzuk ematen dituzte, eta horietako batzuk bakarrik daude letra larriz idatzita. Gainera, mendebaldekoak ez diren beste hizkuntza askok (adibidez, txinera edo arabiera) ez dute inolako kapitalizaziorik. Zeregin horretarako beste termino bat seinaleen sailkapena da.
- Laburpengintza automatikoa (Summarization). Dokumentu baten laburpena lortzea testuan oinarrituta. Erauzketaren kasu bat bezala ikus daiteke baina berezia da, datu-base bat osatu beharrean testuaren ordezkari labur bat lortu nahi baita. Dokumentuen laburpena automatikoki egitea bi eratara bidera daiteke. Modu errazena da testu zati edo esaldi esanguratsuenak hautatzea. Modu zaila erabiltzen denean, aldiz, ideia nagusiak detektatu, integratu eta testu berri bat sortzen da. Testu-editore aurreratuek, hizkuntza-tresnen artean, eskaini ohi dute laburpenak egiteko aukera. Hori eskatuta atzeko planoa markatuta dutela azaltzen dira dokumentuko hainbat esaldi. Erabiltzaileak aukera dezake laburpenaren luzera, alegia, testu osoaren zenbateko portzentajea izan behar den laburpena.
- Dokumentuen analisia.
- Dokumentu-sailkatzaileak. Testu bat emanda bere kategoria edo gaia asmatzea da helburua. IEren ataza gisa ikus daiteke eta modu automatikoan edo semiautomatikoan egin daiteke.
- Dokumentu-multzokatzaileak (Clustering). Arlo askotan erabiltzen den teknika-multzo honek antzekotasuna duten dokumentuak erlazionatzea du helburutzat, berreskuratzea ahaltsuagoa egiteko asmoz askotan. Erauzketaren 2. fasea izaten da batzuetan, multzo berean sartzen baitira erauzitako ezaugarriren bat komunean duten dokumentuak. Terminologia-erauzketa automatikoan adibidez, clustering egin ohi da bigarren fase batean, terminoen hierarkia bat sortzearren erauzitako terminoetatik abiatuta. Aurreko aplikazioetan makina bat dokumentu aldez aurretik ezarritako kategoria multzo txiki baten arabera sailkatu behar ziren. Baina clustering egiten denean, aldez aurretik ez daude definituta kategoria posibleak. Abiapuntuan, hainbat dokumentu dauzkagu, eta bukaeran dokumentu horiek guztiak sailkatuta, haien arteko antzekotasunen arabera. Jakin beharko da geroago interpretatzen zergatik proposatu diren multzo horiek, zer adierazten duten azpimultzo horiek.
- Informazio-bideratzea (routing): informazioa pertsona edo agente desberdinen artean banatzeko teknika multzoa. Sailkapen mota bat da azken finean, baina informazioaren ezaugarriez gain agenteena ere kontuan hartu behar dira. Kazetaritza alorreko adibide pare bat jar daiteke: egunkari batean agentzien berrien banaketa kazetarien artean, edo web bidezko berrien pertsonalizazioa. Batzuetan bideratzea eta iragaztea sinonimotzat hartzen dira.
- Informazio-iragaztea (filtering): dinamikoki jasotzen den informazio ez-interesgarria baztertzean datza. Indar handia hartu du posta elektronikoarekin, iragazte-aplikazioen adibide tipikoa posta elektronikoko spam-mezu guztiak detektatzea eta automatikoki alde batera uztea da. Sailkatzaileen kasu partikular gisa ere ikus daiteke.
- Eleaniztasunerako tresnak
- Bigarren hizkuntza ikasteko sistemak.
- Testu-sorkuntza automatikoa.
- Iritzi-meatzaritza edo sentimendu-analisia
- Sare sozialen analisia
- Sentimenduen analisia. Testu edo esaldi bat emanda, horrek adierazten dituen sentimenduak aztertzea. Sentimenduen analisia metodo konputazionala da, testuaren atzean dagoen asmo emozionala identifikatzeko eta sailkatzeko erabiltzen dena. Teknika horrek testua aztertzea eskatzen du, adierazitako sentimendua positiboa, negatiboa edo neutroa den zehazteko. Sentipenak sailkatzeko ereduek normalean datu-sartzeak erabiltzen dituzte, hala nola, n-grama hitz modeloak, Term Frequency-Inverse Document Frequency (TF-IDF) metodoak, edo testu-sekuentzietan epe luzerako zein epe laburreko mendekotasunak ezagutzeko ikaskuntza-eredu sakonak erabiltzea. Sentimenduen analisiaren aplikazioak askotarikoak dira.
- Testu-inferentzia
- Hitz mailako semantika
Osagaiak
[aldatu | aldatu iturburu kodea]- Analisi morfologikoa.
- Analisi sintaktikoa.
- Interpretazio semantikoa.
- Analisi pragmatikoa.
- Perpausaren planifikazioa.
- Perpausaren sorrera.
Historia
[aldatu | aldatu iturburu kodea]
Hizkuntza naturalaren prozesamenduak 1950ean dauka bere oinarria, non Alan Turing matematikariak Computing machinery and intelligence artikulua publikatu zuen. Artikuluan bertan adimena ebaluatzeko test bat proposatu zuen, Turing testa izenekoa.
Hizkuntza naturalaren prozesamendu sinbolikoa (1950etik 1990era)
1950eko hamarkada: 1954. urtean, Georgetowneko esperimentuak zenbait esaldi errusieratik ingelesera automatikoki itzultzeko helburua izan zuen. Garai hartan, zientzialariek zioten itzulpen automatikoaren ataza hiru edo bost urteko epean erabat konponduta egongo zela. Baina, prozesua motel samarra izan zen, eta 1966ko ALPAC (Automatic Language Processing Advisory Committee; euskaraz, Hizkuntza Prozesamendu Automatikoari Buruzko Aholku Batzordea) txostena argitaratu zenetik, ikerketa jarduera asko murriztu zen. Ondorioz, AEBetan ez zen ia aurrerapenik egin itzulpen automatikoaren esparruan 1980ko hamarkadaren bukaerara arte; orduan sortu baitziren lehen eredu estatistikoak.
1960ko hamarkada: Zenbait sistema arrakastatsu garatu ziren hamarkada horretan, hala nola, SHRDLU izeneko hiztegi itxiko sistema, edo ELIZA sistema, psikoterapeuta humanista baten simulatzailea. Giza pentsamenduaz edo emozioaz ia inolako informaziorik gabe, ELIZA sistemak gizakiaren antzeko elkarreragina eskaintzen zuen batzuetan. "Pazienteak" ezagutza-oinarri oso txikia gainditzen zuenean, ELIZAk erantzun generiko bat eman zezakeen, adibidez, "Buruko mina dut" esaldiari "Zergatik diozu buruko mina daukazula?" erantzuten zuen. Ross Quillianek hizkuntza naturalari buruzko lan arrakastatsua hogei hitzeko hiztegi batekin frogatu zen, hori guztia memoriarekin bat zetorren.
1970eko hamarkada: Hainbat programatzailek mundu errealeko informazioa ordenagailuek ulertzeko moduko datuetan egituratzen zuten “ontologia kontzeptualak” idazten hasi ziren. Horiek horrela, MARGIE (Schank, 1975), SAM (Cullingford, 1978), PAM (Wilensky, 1978), TaleSpin (Meehan, 1976), QUALM (Lehnert, 1977), Politics (Carbonell, 1979) eta Plot Units (Lehnert 1981) sistemak garatu ziren. Horrez gain, lehen txatbotak ere garatu ziren.
1980ko hamarkada: 1980ko hamarkadan eta 1990ekoaren hasieran metodo sinbolikoen goraldia izan zen. Izan ere, garai hartako jakin-min fokuak hauek baitziren: arauetan oinarritutako analisia (esaterako, HPSGren garapena gramatika sortzailearen operazionalizazio konputazional gisa), morfologia (adibidez, bi mailako morfologia), semantika (hala nola, Lesk algoritmoa), erreferentziak (esate baterako, Centering Teoria-ren barrukoak) eta hizkuntza naturala ulertzeko beste arlo batzuk.
Hizkuntza naturalaren prozesamendu estatistikoa (1990etik orain arte)
Ikaste automatikoko algoritmoen arrakastaren ondorioz, eskuz idatzitako erregelen bidezko sistemei utzi zieten. Arrakasta hori bi faktore nagusiren ondorioz izan zen, hala nola, konputazio-potentziaren etengabeko handiagotzea eta Chomskyren teoria linguistikoaren indarra gutxitzea. Izan ere, teoria horren oinarri teorikoak zirela medio, Ikasketa automatikoaren prozesamendura hurbiltzearen oinarrian dagoen corpus linguistiko mota.
1990ko hamarkada: Hizkuntzaren prozesamendu naturalak metodo estatistikoetan izandako lehen arrakasta nabarmenetako asko itzulpen automatikoaren arloan gertatu ziren, batez ere IBM Research enpresak egindako lanaren ondorioz; IBMren lerrokatze-ereduak kasu. Sistema horiek Kanadako Parlamentuak eta Europar Batasunak sortutako testu-gorputz eleaniztuna baliatu ahal izan zuten, gobernu-prozesu guztiak dagozkien gobernu-sistemetako hizkuntza ofizial guztietara itzultzeko eskatzen zuten legeen ondorioz sortua. Hala ere, beste sistema gehienak sistema horiek ezarritako zereginetarako berariaz garatutako corporaren mende zeuden, eta sistema horiek arrakasta izateko muga handia ziren. Ondorioz, ikerketa asko egin dira datu-kopuru mugatuetatik modu eraginkorragoan ikasteko metodoen arloan.
2000ko hamarkada: Interneten hazkundeari esker, 1990eko hamarkadaren erdialdetik aurrera hizkuntzari buruzko datu gordin (idatzi gabeak) gehiago daude sarean. Ikerketa, beraz, gero eta gehiago zentratu da gainbegiratu gabeko eta erdi-gainbegiratuko ikasketa algoritmoetan. Algoritmo horiek nahi diren erantzunekin eskuz idatzi ez diren datuetatik ikas dezakete, edo datu idatzien eta idatzi gabekoen konbinazioa erabiliz. Oro har, zeregin hori ikaskuntza gainbegiratua baino askoz zailagoa da, eta normalean, ez ditu ematen hain emaitza zehatzak sartutako datu-kopuru jakin baterako.
2003: Garai hartan, n-grama hitz modeloa algoritmo estatistikorik onena zen. Hala ere, geruza anitzeko pertzepzio batek gainditzen du, geruza bakar batekin eta hainbat hitzen testuinguruaren luzerarekin, 14 milioi hitzen gainean trebatua.
2010: Tomáš-Mikolovek (garai hartan Brnoko Unibertsitate Teknologikoko doktoregoko ikaslea), kideekin batera, hizkuntza modalizazioari geruza bakar bat zuen neurona-sare errepikakor bat aplikatu zion, eta hurrengo urteetan Word2vec garatzen jarraitu zuen. 2010ko hamarkadan, neurona-sare sakonen (geruza ezkutu asko agertzen dituena) ikasketa automatikoko metodoak asko zabaldu ziren, eta horren ondorioz, hizkuntza naturalaren prozesamenduan hedatu ziren. Ospe hori, neurri batean, teknika horiek emaitza onenak lor ditzaketela erakusten zutelako izan zen, adibidez, hizkuntza modelatzeko eta ‘parsing’ egiteko zereginetan. Hori gero eta garrantzitsuagoa da medikuntzan eta osasun-arretan, non hizkuntza naturalaren prozesamenduak lagundu egiten baitu oharrak eta testuak osasun-erregistro elektronikoetan aztertzen. Bestela, azterketarako eskuraezinak izango lirateke, arreta hobetu edo pazientearen pribatutasuna babestu nahi direnean.
Hizkuntza naturalen prozesamendurako zailtasunak
[aldatu | aldatu iturburu kodea]Anbiguotasuna
[aldatu | aldatu iturburu kodea]Hizkuntza naturala hainbat mailatan anbiguoa izan ohi da:
- Maila lexikalean: hitz bakar batek esanahi ezberdinak izan ditzake, eta hauetako egokiaren hautapena testuinguruaren edo oinarrizko ezagutzaren araberakoa izan behar da. Zentzu honetan ikerketa ezberdinak burutu izan dira, hiztegiak, gramatika, ezagutza oinarriak eta korrelazio estatistikoetan oinarritutako metodoekin.
- Erreferentzia mailan: anafora eta kataforak ebazteak erreferentzia egiten duten aurreko edo ondorengo entitate linguistikoa zehaztea suposatzen du.
- Egitura mailan: Zuhaitz sintaktiko ezberdinak sortzea ondorioztatzen duten sintagma preposizionalen dependentziaren anbiguotasuna argitzeko semantikara jo beharra dago.
- Maila pragmatikoan: Esaldi askok, sarritan, ez dute esaten dena adierazten. Ironiek garrantzi handia dute mezuaren ulermenean.
Anbiguotasun hauek eta beste batzuk ebazteko, arazo nagusia hizkuntza naturalean izaten diren sarrerak anbiguotasunik gabeko barne errepresentazio batean itzultzea da, hala nola, zuhaitz sintaktiko bat.
Hitzen arteko banaketak antzematea
[aldatu | aldatu iturburu kodea]Ahozko hizkuntzan ez dira tarteak uzten hitzen artean. Hitzen arteko tartea bilatzeko, askotan zentzu gramatikala baten bila jo beharra dago testuingurua aztertuta. Idatzizkoan ere, txinera bezalakoek ez dauzkate hitzen arteko tarterik.
Datuak ezegoki jasotzea
[aldatu | aldatu iturburu kodea]Tekleatze-akatsak, OCR bidez jasotzeagatik sortutako erroreak, hitzek tokian-tokiko dituzten aldakuntza bitxiak, hitz egiteko arazo fisikoek sortutako aldaketak eta beste arazo ugarirengatik sarrerako datuen jasotze ezegoki bat gerta daiteke.
Joera orokorrak eta etorkizuneko norabide posibleak
[aldatu | aldatu iturburu kodea]Arlo honetan aspalditik ikusitako joeren arabera, posible da hizkuntza naturalaren prozesamenduaren etorkizuneko norabideak aurreikustea. 2020. urtean, CoNLL Shared Tasks izeneko kongresuan, hiru joera nagusi nabaritu ziren gaien artean:
- Hizkuntzaren alderdi gero eta abstraktuagoa eta kognitiboekiko interes handiagoa
- 1999–2001: azaleko analisia
- 2002–03: entitate nabarmenen ezagutza
- 2006–09/2017–18: dependentzia-sintaxia
- 2004–05/2008–09: paper semantikoen etiketatzea
- 2011–12: koerreferentzia
- 2015–16 analisi diskurtsiboen analisi-gramatikala
- 2019: Analisi-semantikoa
- Hizkuntza aniztasunarekiko eta, beharbada, multimoduarekiko interesa handitzea
- Ingelesa 1999tik, gaztelania eta nederlandera 2002tik, alemana 2003tik, bulgariera, daniera, japoniera, portugesa, esloveniera, suediera, turkiera 2006tik, euskara, katalana, txinera, greziera, hungariera, italiera, turkiera 2007tik, txekiera 2009tik, arabiera 2012tik eta beste hainbat hizkuntza geroago sartzen joan ziren sisteman.
- Ordezkaritza sinbolikoak ezabatzea
- Arauetan oinarritutako metodoetatik gainbegiratutakoetara eta hortik ahulki gainbegiratutako metodoetara, ordezkaritza-ikaskuntzara eta muturretatik-muturrerako sistemetara iritsi da prozesua.
Erreferentziak
[aldatu | aldatu iturburu kodea]- ↑ «Hizkuntzaren prozesamendua [Sareko Euskal Gramatika»] www.ehu.eus (kontsulta data: 2019-01-22).
Bibliografia
[aldatu | aldatu iturburu kodea]- Daniel Jurafsky and James H. Martin (2008).
Speech and Language Processing,
2nd edition. Pearson Prentice Hall. ISBN 978-0-13-187321-6. - Steven Bird, Ewan Klein, and Edward Loper (2009).
Natural Language Processing with Python.
O'Reilly Media. ISBN 978-0-596-51649-9.* Manning C. and Schütze H. Foundations of Statistical Natural Language Processing. MIT Press. Cambridge, MA: May 1999. nlp.stanford.edu/fsnlp/ - Christopher D. Manning, Prabhakar Raghavan, and Hinrich Schütze (2008).
Introduction to Information Retrieval.
Cambridge University Press. ISBN 978-0-521-86571-5. - Manning C. and Schütze H. (2008).
Foundations of Statistical Natural Language Processing
MIT Press. Cambridge, MA: May 1999. nlp.stanford.edu/fsnlp/ - Hizkuntzalaritza konputazionala atala Sareko Euskal Gramatika (SEG). 2011.
- Aldezabal I., Arriola J., Díaz de Ilarraza A., Sarasola K. (2005)
Hizkuntzalaritza Konputazionala[Betiko hautsitako esteka].
Udako Euskal Unibertsitatea, Bilbo 2005. HIZTEK saila. - Aitzol Astigarraga, Koldo Gojenola, Kepa Sarasola, Aitor Soroa. (2009)
Testu-analisirako PERL erremintak[Betiko hautsitako esteka].
ISBN: 978-84-8438-233-1,Udako Euskal Unibertsitatea (UEU). Bilbo. http://www.unibertsitatea.net/blogak/testuak-lantzen - Alegria I., Urkia M. (2002)
Morfologia Konputazionala. Euskararen morfologiaren deskribapena[Betiko hautsitako esteka] Hizkuntza teknologia (Hiztek) graduondokoa UEU, Bilbo 2002
Ikus, gainera
[aldatu | aldatu iturburu kodea]Kanpo estekak
[aldatu | aldatu iturburu kodea]- Hizkuntzalaritza konputazionala Wikipedia-kategoriako artikulu bisitatuenak
- Hizkuntzaren Prozesamenduko Wikipedia-kategoriako artikulu bisitatuenak
- HAP masterra. EHUko Hizkuntzaren Azterketa eta Prozesamendua masterra.
- Hitz zentroa Euskal Herriko Unibertsitatea.
- Ixa taldea. EHUko ikerketa taldea.
- Aholab laborategia. Hizketaren tratamendua.
- Elhuyar hizkuntza zerbitzuen I+G unitatea[Betiko hautsitako esteka]
- Berbatek. Hiru urterako (2009-2011) ikerketa estrategikoko proiektu bat da, eta Elhuyar Fundazioak, EHUko Ixa eta Aholab ikerketa-taldeek eta Vicomtech eta Robotiker teknologia-zentroek osatzen dute proiektu hori gauzatzeko partzuergoa.
- Langune hizkuntzen Industriaren alorreko Euskal Herriko enpresen elkartea da. Elkarte hau 2010an sortu da eta itzulpengintza, edukiak, irakaskuntza eta hizkuntzen teknologiaren alorreko 30 enpresatik gora elkartzen ditu.
- Euskarazko softwarea (Eusko JaurlaritzaJ)
- Hizkuntz softwarea (Softkat-UEU)
- Hizkuntza-Teknologiak. Ixa taldearen bloga.
- Ber2a Elhuyar Hizkuntza-Zerbitzuen bloga.
- Iparorratza. Andoni Sagarnaren bloga.
- Hizkuntzaren prozesamenduko estekak Ixa taldearen webgunean.
- Hizkuntzaren prozesamendua ZTHn (Zientzia eta Teknologiaren Hiztegi entziklopedikoan)
- Hizkuntzalaritza konputazionala atala Sareko Euskal Gramatikan (SEG) 2011
- (Ingelesez) Blogak ingelesez ACLwikin (CL, NLP, linguistics, language...)
- (Ingelesez) Ixa Group. Language Technology. Ixa taldearen ingelesezko bloga