Hur jämför ni översättningskvaliteten i GPT, Claude och DeepL?

Snabbt svar

Benchmarking av översättningskvalitet över motorer som GPT-4o, Claude 3.5 Sonnet och DeepL kräver tre komponenter: en representativ testuppsättning hämtad från dina faktiska innehållstyper och språkpar, standardiserad automatiserad poängsättning med hjälp av mätvärden som BLEU, MetricX eller COMET, och ett konsekvent utvärderingsramverk som tillämpas identiskt på alla motorer. Ingen enskild motor vinner över alla språkpar och innehållstyper. Det praktiska målet med benchmarking är att identifiera vilken motor som fungerar bäst för ditt specifika innehåll i stor skala och sedan dirigera produktionsjobb automatiskt till den motorn. Smartlings AI Hub utvärderar motorns prestanda kontinuerligt och dirigerar varje sträng till den högpresterande motorn för dess språkpar och innehållstyp.

Varför benchmarking av översättningsmotorer inte är enkelt

Översättningsmotorns prestanda varierar avsevärt beroende på språkpar, innehållstyp och domän. En motor som producerar stark spansk marknadsföringskopia kan underprestera på japansk teknisk dokumentation. Ett riktmärke som endast bygger på offentliga testuppsättningar kanske inte återspeglar organisationens faktiska innehåll, vilket innebär att vinnaren i en standardiserad utvärdering kanske inte är vinnaren i produktionen.

De tre vanligaste misstagen i benchmarking av översättning är att använda en för liten testuppsättning, tillämpa olika utvärderingskriterier på olika motorer och behandla en benchmarkkörning som ett engångsbeslut snarare än en pågående mätning. LLM-översättningskvaliteten ändras med varje modelluppdatering, vilket innebär att en motor som rankades tredje för sex månader sedan nu kan överträffa den tidigare ledaren.

 

Vilka automatiserade poängmetoder mäter faktiskt

 
BLEU (Tvåspråkig utvärderingsstudie)

BLEU-poäng mäter överlappningen mellan en maskinöversatt utgång och en mänsklig referensöversättning, uttryckt som ett värde mellan 0 och 1. BLEU är snabb och används ofta som baslinje, men det belönar ordmatchningar på ytnivå snarare än semantisk noggrannhet, vilket innebär att en flytande hallucination kan få bra poäng medan en korrekt men annorlunda formulerad översättning får dåligt resultat. För benchmarking av företag är BLEU användbart som ett förstapassfilter men otillräckligt som en fristående kvalitetssignal.

 
MetricX och COMET

MetricX (Google) och COMET (Unbabel) är neurala utvärderingsmått som använder språkmodeller för att bedöma översättningskvalitet genom att jämföra källtext, maskinutdata och referensöversättningar över semantiska dimensioner. Båda korrelerar starkare med mänskligt omdöme än BLEU, särskilt för att upptäcka flytande fel och meningsförändringar. För företagsprogram somvärderar LLM-översättning i stor skala ger MetricX och COMET en mer tillförlitlig signal än enbart BLEU.

 
Mänsklig utvärdering som valideringsskikt

Automatiserade mätvärden mäter översättningskvaliteten i förhållande till en referens. Mänskliga utvärderare bedömer om en översättning fungerar i ett sammanhang, upprätthåller varumärkesrösten och läser naturligt för en som har modersmål. För innehållstyper med höga insatser begränsar automatiserad benchmarking fältet och mänsklig utvärdering validerar vinnaren innan ett beslut om produktionsrutning fattas.

 

Så här kör du ett översättningsriktmärke som ger handlingsbara resultat

  • Bygg en representativ testuppsättning. Välj 200 till 500 källsträngar från ditt faktiska produktionsinnehåll, som täcker de språkpar, innehållstyper och domäner du bryr dig mest om. Ett riktmärke som bygger på generiska offentliga testdata förutsäger inte hur en motor presterar på din marknadsföringskopia, hjälpcenterartiklar eller produkt-gränssnittssträngar.
  • Kör identiska strängar genom varje motor. Skicka samma källsträngar till GPT-4o, Claude 3.5 Sonnet, DeepL och andra motorer som utvärderas utan förbehandlingsskillnader mellan dem. Kontrollerade förhållanden är det enda sättet att isolera motorns prestanda från andra variabler.
  • Poäng med MetricX eller COMET som primära mätvärden. Tillämpa identisk poängsättning på alla utgångar. Spåra poäng efter språkpar och innehållstyp snarare än medelvärde för alla resultat, eftersom aggregerade poäng kan maskera betydande variation per språk.
  • Använd ditt översättningsminne och ordlista innan du jämför. Översättningskvaliteten för företag beror delvis på hur väl en motor integreras med dina befintliga språkliga tillgångar. Jämför motorer under förhållanden som inkluderar din ordlista och TM snarare än att utvärdera rå motoreffekt isolerat.
  • Planera för löpande mätning. LLM-översättnings funktioner ändras med varje modellutgåva. En benchmark-körning är en ögonblicksbild. Team som dirigerar jobb baserat på kontinuerliga prestandadata snarare än ett enda riktmärkesbeslut upprätthåller bättre kvalitet över tid.

När benchmarking av översättning är rätt prioritet

Företagsprogram som utvärderar vilken LLM- eller MT-motor som ska användas som standard för produktionsöversättning och behöver objektiva, repeterbara data för att stödja beslutet.
Team som har märkt kvalitetsvariationer mellan språkpar och vill förstå om dirigering av olika par till olika motorer skulle förbättra den totala utskriftskvaliteten.
Organisationer som introducerar en ny motor och behöver validera dess prestanda mot sin befintliga produktionsbaslinje innan de byter.
Program som vill minska mänsklig redigeringstid genom att identifiera vilken motor som producerar den starkaste förstapassutmatningen för sina specifika innehållstyper.

När ett formellt riktmärke kanske inte är nödvändigt

⚠️

Program tidigt i antagandet av AI-översättning där etablering av grundläggande arbetsflöden, ordlistor och TM är den omedelbara prioriteringen och motorvalet kan skjutas upp tills volymen motiverar benchmarking-investeringen.

⚠️

Team som använder en plattform med inbyggd motorrouting som utvärderar och dirigerar automatiskt, där benchmarkingen hanteras av plattformen snarare än manuellt av lokaliseringsteamet.

Hur hanterar Smartling motorbenchmarking och routing?

Smartlings AI Hub utvärderar översättningskvaliteten i mer än 20 LLM och MT-motorer, inklusive GPT-4o, Claude 3.5 Sonnet, DeepL, Amazon Bedrock, Google Ver tex och andra. Smartlings AI-team genomför regelbunden benchmarking med MetricX, COMET och BLEU för att utvärdera motorprestanda över innehållstyper och språkpar. Resultaten informerar Smartlings Auto Select-routing, som tilldelar varje sträng till den högpresterande motorn för sitt specifika språkpar och innehållstyp snarare än att tillämpa en enda motor universellt.

För företagsteam som vill köra sina egna jämförelser stöder Smartlings plattform konfigurerbara LLM-profiler som gör det möjligt för team att testa olika motorkonfigurationer på produktionsinnehåll innan de anger en standardrutningsregel.

 

Hjälpdokument: Smartling Auto Select MT

Hjälpdokument: Smartling Auto Select LLM

Jämförelse av översättningskvalitet över GPT, Claude och DeepL

Smartlings AI Hub utvärderar översättningskvaliteten över mer än 20 LLM och MT-motorer och dirigerar varje sträng till den motor som presterar bäst för sitt språkpar och innehållstyp. Se hur företagsteam använder Auto Select för att ta bort gissningarna från motorvalet.