Ditt lokaliseringsteam har två alternativ för ett parti AI-översatt innehåll: granska varje segment innan det skickas, eller lita på resultatet och publicera det som det är. Inget av tillvägagångssätten fungerar bra i stor skala
En är för långsam. Den andra är för riskabel.
AI-kvalitetsuppskattning erbjuder ett tredje alternativ. Istället för att vänta på att en människa ska bedöma kvalitet efter översättning, förutspår den kvalitet under översättningen, flaggar exakt vilka segment som sannolikt behöver en ny titt och låter resten gå framåt. Recension slutar vara allt-eller-ingenting.
Den här artikeln går igenom vad AI-kvalitetsuppskattning är, hur förtroendepoäng fungerar, var det passar tillsammans mänsklig granskning i lokaliseringsarbetsflödet, och hur det förändrar kvalitetsekonomin utan att eliminera mänskligt omdöme.
Vad är AI-kvalitetsuppskattning
AI-kvalitetsuppskattning förutsäger kvaliteten på en översättning utan att jämföra den med en mänsklig referens.
Modeller utbildade i översättningsfelmönster ger en konfidenssignal för varje översatt segment
Det skiljer sig från traditionella Språklig kvalitetssäkring (LQA) (LQA). LQA utvärderar översättningar efter att de har producerats, med hjälp av mänskliga granskare eller referensöversättningar för att få kvalitet. Kvalitetsuppskattning sker före eller under översättningen, vilket ger ditt team en signal som agerar på sig själv omedelbart istället för att vänta på en granskningscykel.
Utgången är en poäng, inte en dom. Vad ditt team gör med poängen beror på hur arbetsflödet dirigerar flaggade segment.
Hur AI-kvalitetsuppskattning fungerar
Kvalitetsuppskattningsmodeller tränas för att känna igen de mönster som signalerar troliga översättningsfel. Tvetydig frasering, terminologiska felmatchningar, strukturella avvikelser och motorutgång med låg konfidens dyker alla upp som funktioner som modellen kan få.
Varje översatt segment får ett konfidensresultat som återspeglar hur sannolikt resultatet är att vara korrekt. Poängen sitter inne i arbetsflödet, redo för nedströms routningsregler att agera på.
Segment med lågt förtroende flaggar för mänsklig uppmärksamhet. Segment med hög konfidens går framåt utan manuell kontroll, på grundval av samma routningslogik som styr vilken översättningsmetod ett projekt använder i första hand.
Där AI-kvalitetsuppskattning passar in i arbetsflödet
Kvalitetsuppskattning finns inom översättningsarbetsflödet, inte som en separat granskningsprocess. När förtroendesignalen är tillgänglig förändras fyra saker om hur ditt team genomför granskning.
Screening före publicering
Screening före publicering är det första stället kvalitetsuppskattning tjänar på. Varje segment får poäng innan det publiceras, och poängen driver nedströms routing snarare än att sitta i en instrumentpanel för senare granskning.
Alternativet är vad de flesta lag har ärvt. Fel dyker upp efter publicering när ett kundklagomål, en stickprovskontroll eller en dålig recension uppmärksammar dem, och korrigering är dyrare vid den tidpunkten än förebyggande skulle ha varit.
Förtroendebaserad routing
Förtroendebaserad routing förvandlar varje poäng till ett arbetsflödesbeslut. Segment under konfidensgränsen leder till mänsklig granskning; segment ovanför den publiceras utan manuell kontroll, med samma regler som styr vilken översättningsmetod ett projekt använder.
Hantering av översättningsarbetsflöden redan dirigerar innehåll efter risk, innehållstyp och språk, och Smartlings dynamiska arbetsflöden använda kvalitetsuppskattningsnivån som ett ytterligare beslutskriterium efter maskinöversättningssteget. Kvalitetsuppskattning lägger till en annan routingsignal till samma arbetsflödesmotor, så beslutet att skicka en segment för mänsklig granskning blir datadriven snarare än volymdriven.
Minska översynskostnader
Granskare spenderar sin tid på segment som faktiskt behöver uppmärksamhet. Smartlings Uppskattning av språkkvalitet (LQE) Agent betygsätter varje maskinöversatt segment och uppskattar hur mycket mänsklig redigering det behöver. Granskningsinsatsen koncentreras på de flaggade segment med låg konfidens som modellen yter i stället för att ta en fast procentandel av varje projekt.
Ekonomin förändras därefter. Volym som tidigare krävde proportionellt granskningsantal rensar nu rörledningen för modellförtroende, och mänsklig granskning går från en flaskhals till ett riktat steg.
Personio såg denna förändring på dess supportinnehåll. HR-teknikföretaget förutspådde en 50% minskning av den interna granskningstiden genom att dirigera innehåll Maskinöversättning (MT) med en lämplig förtroendebaserad granskningsväg, samtidigt som översättningsbudgeten minskas med 40%. Den frigjorda granskningskapaciteten återinvesterades i att utöka språktäckningen snarare än att öka personalnivån.
Skyddsräcken mot hallucinationer
Kvalitetsuppskattning fungerar också som skyddsräcke mot LLM hallucination.
När en AI-översättning skiljer sig från källan genom att introducera innehåll som inte finns där, släppa innehåll som är eller återge terminologi felaktigt, konfidensbetyget fångar problemet innan det publiceras.
Smartlings AI Hub lägger till hallucinationsbegränsning och LLM-leverantörskontroller som fungerar tillsammans med kvalitetssignalen. Tillsammans håller lagren AI-utdata styrd snarare än att lämnas till vad den råa modellen producerar på en given begäran.
Netskope illustrerar den operativa effekten. Cybersäkerhetsföretaget uppnådde cirka 95% snabbare handläggningstid och sparade hundratusentals dollar på ett enda år med hjälp av Smartlings AI Hub, med styrningskontroller som höll AI-produktionen redo för produktion i stor skala.
Traditionell granskning kontra AI-kvalitetsuppskattning
Traditionell granskning efter översättning och AI-kvalitetsuppskattning löser relaterade problem på olika sätt.
|
Faktor |
Traditionell granskning efter översättning |
AI-kvalitetsuppskattning |
|---|---|---|
|
När det händer |
När översättningen är klar |
Före eller under översättningen |
|
Vad det kräver |
En mänsklig granskare eller referensöversättning |
Ingen mänsklig referens behövs för att få en signal |
|
Täckning |
Vanligtvis ett prov, på grund av granskarens kapacitet |
Varje segment, poängsätts automatiskt |
|
Granska insatsen |
Sprid jämnt över innehållet |
Koncentrerad på flaggade segment med låg konfidens |
|
Snabb publicering |
Inhägnad av granskarens tillgänglighet |
Innehåll med högt förtroende flyttas omedelbart |
Vad händer utan kvalitetsuppskattning
Utan kvalitetsuppskattning ligger granskningen i en av två ytterligheter. Antingen granskas varje segment, vilket bromsar leveransen och begränsar hur mycket innehåll som kan skalas, eller så sjunker granskningstäckningen till ett prov, vilket släpper igenom fel.
Även med ett urval spenderas granskningsresurser jämnt över innehållet, oavsett vilka segment som faktiskt bär risk. En senior granskare inspekterar en rutinmässig supportartikel i samma takt som en juridisk ansvarsfriskrivning.
IBM visar vad målinriktad granskning ger i stor skala. Teknikföretaget förbättrade översättningskvaliteten med 40% och minskade den genomsnittliga tiden till marknaden med över 50% genom att para ihop AI Human Translation med mänsklig validering på de segment där det betydde mest, snarare än heltäckande granskning av allt.
Kvalitetsuppskattning tar inte bort mänskligt omdöme från processen. Det berättar för ditt team exakt var den bedömningen är värd att spendera.
Förvandla kvalitet till en signal, inte en dom
Kvalitetsuppskattning omvandlar översättningskvaliteten från en post-hoc-bedömning till en signal som ditt team agerar på innan innehållet skickas. Förtroendebaserad routing låter ditt team granska med undantag i stället för att granska allt.
För mer information om hur Smartling kan hjälpa dig att upprätthålla översättningskvaliteten i stor skala, boka ett möte med oss idag.