TY - JOUR
T1 - Resolució anafòrica en traducció automàtica
T2 - el cas de l’espanyol i el català
AU - Alvarez-Vidal, Sergi
N1 - Publisher Copyright:
© 2024 Universidade do Minho. All rights reserved.
PY - 2024/6/27
Y1 - 2024/6/27
N2 - presència no només en el sector de la traducció sinó també en el conjunt de la societat, en part pels bons resultats de qualitat obtinguts per la traducció automàtica neuronal (TAN). Actualment, els models massius de llenguatge (MML) com ara GPT (Generic Pre-trained Transformer) poden generar text sobre una infinitat de temes diferents i també traduir documents tenint en compte un context més ampli. Tot i així, per a idiomes estretament relacionats, com ara l'espanyol i el català, la traducció automàtica basada en regles (TABR) s'utilitza diàriament per traduir milers de paraules.
Aquest article estudia la TAN, TABR i GPT del castellà al català, dues llengües romàniques amb una estructura molt semblant en les quals els sistemes de TABR han demostrat un bon rendiment. Utilitzem un challenge test set centrat en la resolució d'anàfores, específicament els pronoms febles, un grup de pronoms que no tenen
una correlació directa entre les dues llengües. Com que els models de TABR només tenen en compte la informació a nivell de frase, només estudiem les aparicions intraoracionals. L'objectiu és avaluar un fenomen sintàctic complex que ens pot ajudar a entendre quin dels tres sistemes tradueix més bé els elements contextuals.
Els resultats mostren que els dos models GPT provats són els que produeixen el nombre més baix d'errors, seguit dels sistemes de TAN. Tot i així, el nombre de traduccions errònies en el millor sistema és del 47%, cosa que contrasta amb els bons resultats d'avaluació generals que s'obtenen per a aquest parell de llengües.
AB - presència no només en el sector de la traducció sinó també en el conjunt de la societat, en part pels bons resultats de qualitat obtinguts per la traducció automàtica neuronal (TAN). Actualment, els models massius de llenguatge (MML) com ara GPT (Generic Pre-trained Transformer) poden generar text sobre una infinitat de temes diferents i també traduir documents tenint en compte un context més ampli. Tot i així, per a idiomes estretament relacionats, com ara l'espanyol i el català, la traducció automàtica basada en regles (TABR) s'utilitza diàriament per traduir milers de paraules.
Aquest article estudia la TAN, TABR i GPT del castellà al català, dues llengües romàniques amb una estructura molt semblant en les quals els sistemes de TABR han demostrat un bon rendiment. Utilitzem un challenge test set centrat en la resolució d'anàfores, específicament els pronoms febles, un grup de pronoms que no tenen
una correlació directa entre les dues llengües. Com que els models de TABR només tenen en compte la informació a nivell de frase, només estudiem les aparicions intraoracionals. L'objectiu és avaluar un fenomen sintàctic complex que ens pot ajudar a entendre quin dels tres sistemes tradueix més bé els elements contextuals.
Els resultats mostren que els dos models GPT provats són els que produeixen el nombre més baix d'errors, seguit dels sistemes de TAN. Tot i així, el nombre de traduccions errònies en el millor sistema és del 47%, cosa que contrasta amb els bons resultats d'avaluació generals que s'obtenen per a aquest parell de llengües.
KW - Rule-based machine translation
KW - Neural machine translation
KW - Mt
KW - Anaphora
KW - Gpt
KW - Llm
KW - Machine translation
KW - Weak pronouns
UR - https://www.scopus.com/pages/publications/85199561016
UR - https://portalrecerca.uab.cat/en/publications/dc200ea4-b3a9-49e0-9e15-f3ab346cc0dd
UR - https://www.mendeley.com/catalogue/98b06c8d-b494-3691-833b-f58f3252a815/
UR - https://dialnet.unirioja.es/servlet/articulo?codigo=9638328
U2 - 10.21814/lm.16.1.424
DO - 10.21814/lm.16.1.424
M3 - Article
AN - SCOPUS:85199561016
SN - 1647-0818
VL - 16
SP - 3
EP - 13
JO - Linguamatica
JF - Linguamatica
IS - 1
ER -