HTR · 03

Gyakorlati példa: HTR-modell létrehozása egy levéltári kötethez

Megjelent: Frissítve: Kiadó: Vestigia Scriptorium

Képzeljük el, hogy van egy digitalizált 300 oldalas telekkönyvünk. A könyv több évtized alatt készült, és több írástudó bejegyzéseit tartalmazza. A cél nem a teljes forrás diplomáciai kiadásának elkészítése, hanem egy kellõen jó minõségû automatikus átírás, amelyben lehetõvé válik személynevek, helynevek, tanyaszámok és egyéb adatok keresése.

Ez a példa egy gyakorlati eljárást mutat be saját HTR modelljének létrehozásához.

1. Ne kezdje az első ötven oldal átírásával

Az első intuitív eljárás általában egyszerű: nyissa ki a könyvet az elején, és fokozatosan írja át az oldalakat, amíg elegendő Ground Truth.

Egy ilyen kiválasztás azonban nem reprezentatív tanításkészletet eredményezhet. Például, ha az első 80 oldalt egy írnok írta, a könyv többi részét pedig más írnok, akkor a modell nagyon jól megtanulja az első írásjegyet, de a könyv többi részében lényegesen rosszabbul teljesíthet.

Ezért először is célszerű részletes átírás nélkül végigmenni a teljes dokumentumon, és megtudni annak alapvető felépítését.

A könyv minden egyes részéhez elsősorban a következőket figyeljük:

  • írásbeli kézcsere,
  • jelentős időszaki változások,
  • nyelvi vagy helyesírási változások,
  • különböző típusú bejegyzések,
  • oldalelrendezés módosítások,
  • asztalok és formaalkatrészek,
  • sérült vagy rosszul beolvasott oldalak.

Ez például azt eredményezheti, hogy az 1-90. oldalakat többnyire A, a 91-210. oldalakat B írnok írta, az utolsó rész pedig B, C és D írástudók bejegyzéseit tartalmazza.

Ez az egyszerű elemzés fontosabb a további munkához, mint egy bizonyos számú átírt oldal mechanikus elérése.

2. Válassza ki az első Ground Truth készletet

Egy 300 oldalas könyvből kiválaszthatunk például 40-50 oldalt az első kísérlethez. Ez azonban nem univerzálisan ajánlott szám; a tényleges igény az oldalon található szöveg mennyiségétől és a kézírás változékonyságától függ.

A teljes könyv oldalait választjuk ki.

Egy szemléltető válogatás a következőképpen nézhet ki:

A könyv részeKarakterOldalak a következőhöz: Ground Truth
1–90. o.írnok A15
91–210. o.írnok B15
211–260. o.írnokok B és C10
261–300. o.írnokok C és D10
Összesen50

Még ez az arány sem minden körülmények között ideális. Például, ha D írnok csak néhány rövid bejegyzést tartalmaz a könyvben, nem biztos, hogy célszerű ugyanannyi oktatási oldalt szentelni neki, mint a fő írnoknak.

A cél egy reprezentatív minta létrehozása az anyagból, amelyet a modell később valóban elolvas.

3. A Ground Truth létrehozása előtt határozza meg az átírás szabályait

Mielőtt elkezdenénk több tíz oldal átírását, célszerű egy rövid dokumentumot készíteni átírási szabályokkal.

Az ingatlan-nyilvántartáshoz például a következőket állítjuk be:

  • megtartjuk az eredeti írásmódot;
  • nem korszerűsítjük a történeti szóalakokat;
  • az eredeti szerint őrizzük meg a nagy- és kisbetűket, ha azok megbízhatóan megállapíthatók;
  • csak ott írunk írásjeleket, ahol az valóban szerepel a dokumentumban;
  • A rövidítéseket nem írják át modern formában;
  • egységesen írjuk át a történeti írásjeleket;
  • az olvashatatlan helyeket mindig ugyanúgy jelöljük;
  • nem aszerint írjuk át a szöveget, hogy a szövegkörnyezet alapján szerintünk "le kellett volna írni", hanem a szerint, ami valóban olvasható.

A konkrét szabályok projektenként változhatnak. Fontos, hogy a szabályok ne változzanak önkényesen a Ground Truth létrehozása közben.

Például, ha az egyik személy szó szerint átír egy történelmi rövidítést, a másik pedig automatikusan kibontja, akkor a modell két különböző választ kap ugyanarra a vizuális jelenségre.

4. Végezze el a szegmentálást és ellenőrizze a vonalakat

A kiválasztott 50 oldalon tördelési elemzést végzünk.

Az automatikus szegmentálás általában jelentősen felgyorsítja a munkát, de az eredményt ellenőrizni fogjuk. Különösen a következőkre fogunk összpontosítani:

  • hiányzó sorok,
  • két csatlakoztatott vonal,
  • egy sor helytelenül több részre van osztva,
  • széljegyzetek,
  • címek,
  • szöveg benyúlik a kötésbe,
  • áthúzva, és további bejegyzéseket szúrt be.

Csak ezután hozzuk létre vagy javítjuk ki magát az átírást.

5. Hozza létre az első Ground Truth

Ha rendelkezünk egy megfelelő általános HTR modellel a megfelelő nyelvre, időszakra és kézírásra, először futtathatjuk a kiválasztott oldalakon, és manuálisan javíthatjuk a kimenetét.

Ha nem létezik megfelelő modell, vagy nagyon rosszak az eredményei, manuálisan készítjük el az átírást.

Az eredménynek egy párnak kell lennie:

soros kép → ellenőrzött soros átírás

Ezek az adatok jelentik a jövő modelljének valódi alapját.

Jelenleg nem érdemes időt spórolni a minőség rovására. Ha 50 oldalnyi pontatlan Ground Truth-t hozunk létre, nem kapunk jobb oktatási anyagot, mint ha egy kisebb, de gondosan áttekintett adatkészletet hozunk létre.

6. Tegye félre az adatok egy részét az ellenőrzéshez

Az elkészített Ground Truth lapokból kijelöljük azoknak az oldalaknak egy részét, amelyeken a modell minőségét figyeljük a képzés során.

50 oldalnál például a következőket használhatjuk:

45 oldal az edzőkészlethez
5 oldal az érvényesítési készlethez

Az osztás azonban nem lehet tisztán véletlenszerű, ha ez nem reprezentatív érvényesítési halmazt eredményezne. Például az öt érvényesítési oldalnak nem csak az A írnoktól kell származnia.

Ha a cél egy komolyabb értékelés, akkor az elején célszerű még néhány oldalt félretenni tesztkészletként. Sem saját képzésünkre, sem modellfejlesztés során folyamatos döntéshozatalra nem fogjuk felhasználni.

7. Az első modell betanítása

Egyedi képzés most elindítható.

Ha létezik hasonló történeti anyagon készült minőségi modell, akkor általában célszerű először alapmodellként használni, és továbbképzéssel létrehozni egy speciális változatot.

Ezen túlmenően a használt rendszer lehetőségeinek függvényében kísérletileg is elkészíthető megfelelő előre betanított alap nélküli modell, és az eredmények összehasonlíthatók.

Az első tréning célja még nem biztos, hogy egy végleges modell megalkotása. Főleg arról van szó, hogy megtudjuk, mit tudott tanulni a modell az elkészített adatokból, és hol vannak problémái.

8. Ne értékelje a modellt csak egy CER

A képzés elvégzése után az érvényesítési adatokon megkapjuk a Character Error Rate értéket. Tegyük fel például, hogy a modell eléri:

CER = 7,2%

Maga a szám ígéretesnek tűnik, de nem árulja el, hogy a modell alkalmas-e az egész könyvhöz.

Ezért ki kell deríteni, mely hibák alkotják ezt a 7,2%-ot.

Ha a modell elsősorban az írásjeleket vagy a nagybetűk egyes változatait keveri össze, akkor már nagyon jól használható lehet teljes szöveges kereséseknél.

Ha azonban szisztematikusan torzítja:

  • vezetéknevek,
  • helynevek,
  • számok,
  • dátumok,
  • pénzösszeg,

problémás lehet a tervezett történeti kutatás szempontjából még egy viszonylag jó általános CER esetén is.

9. Tesztelje az egyes írástudókat

Most felveszünk néhány oldalt, amit a modell egyáltalán nem látott tanítás közben.

Az eredmény például így nézhet ki:

ScribeIndikatív CER a tesztoldalakon
A3,8 %
B5,1 %
C8,7 %
D15,4 %

Az egész modell átlagos eredménye kielégítőnek tűnhet. A táblázat azonban ennél lényegesebbet mutat: a modell nagyon jól kezeli az A-t és a B-t, a C-t rosszul, a D-nél pedig jelentős kudarcot vall.

Tehát nem biztos, hogy a teljes könyvből véletlenszerű oldalak hozzáadása nem megoldás.

Sokkal hasznosabb lesz másik Ground Truth létrehozása, főként D és esetleg C írnok kézírásából.

10. Használja az első modellt további adatok létrehozásához

Most alkalmazzuk az első egyedi modellt más reprezentatív oldalakon.

Például eredetileg 20 percet töltöttünk egy oldal kézi átírásával. Az első modell már tud olyan átiratot készíteni, amelynek manuális javítása lényegesen kevesebb időt vesz igénybe.

A javított oldalak új Ground Truth lesz.

Ez létrehoz egy munkaciklust:

kézi Ground Truth → 1. modell → automatikus átírás → javítás → kiterjesztett Ground Truth → 2. modell

A második modell például az eredeti 45 oktatóoldalon oktatható, kiegészítve további 20 oldallal, amelyek főként az írnokokra koncentráltak, akiknél az első modell megbukott.

11. Ismételje meg a tesztet ugyanazokkal a független adatokkal

A modell második verziójának elkészítése után megismételjük az értékelést.

Például a következőket kaphatjuk:

Scribe1. modell2. modell
A3,8 %3,6 %
B5,1 %4,5 %
C8,7 %5,9 %
D15,4 %7,8 %

Egy ilyen eredmény azt mutatná, hogy a megcélzott Ground Truth bővítés valóban segített.

A feltüntetett számok csak egy modellpélda, nem a tényleges archív dokumentum várható értékei.

12. Mikor kell abbahagyni a tanítást

Nincs olyan CER határérték, amelynél a modell automatikusan „kész lesz”.

A cél dönt.

Ha egy történelmi forrás kritikai kiadását akarjuk létrehozni, akkor valószínűleg mindenesetre szükségünk lesz gyakorlatilag a teljes szöveg emberi felülvizsgálatára.

Ha azonban 300 oldalt kell elérhetővé tennünk a teljes szövegű kereséshez és az azt követő kutatási munkákhoz, a CER további 5%-ról 3%-ra csökkentésének előnye kevesebb lehet, mint a további Ground Truth adatok létrehozásához szükséges munka mennyisége.

Ezért valamikor gyakorlati kérdés merül fel:

Megéri-e még munkát fektetni a továbbképzésbe, vagy kifizetődőbb a megmaradt dokumentumokon futtatni a modellt?

A válasz a kapott adatok tervezett felhasználásától függ.

13. Futtassa a modellt a teljes könyvön

Miután a modell elfogadható minőségű a reprezentatív tesztoldalakon, felhasználhatjuk a könyv fennmaradó körülbelül 230-250 oldalán.

A munkának azonban nem kell ezzel véget érnie.

Az automatikus átírás további lehet:

  • manuálisan javítható,
  • indexelve,
  • A teljes szövegben kereshető,
  • A XML-be vagy más strukturált formátumba exportálható,
  • A személyek és helyek keresésére használható,
  • A adatbázis-rekordokhoz kapcsolódik,
  • A további automatikus feldolgozás alapjául szolgálhat.

Egy archív adatprojektnél fontos megőrizni az átirat és a dokumentum eredeti képe közötti kapcsolatot a kapott szöveg mellett. A kutató így bármikor visszatérhet az eredetihez, és ellenőrizheti az automatikusan felismert adatokat.

Mit vegyünk le a példából

A legfontosabb alapelv az, hogy ne „lehetőleg több oldalt írjunk át”. A cél a lehetőleg kisebb, de kellően reprezentatív és minőségi Ground Truth elkészítése, amely megfelel a feldolgozott anyag valós változékonyságának.

Az első projektnél a teljes eljárás leegyszerűsíthető:

1. A teljes dokumentum megtekintése.
2. Azonosítsa a főbb írnokokat és a bejegyzések típusait.
3. Válasszon reprezentatív oldalakat.
4. Hozzon létre egységes átírási szabályokat.
5. Ellenőrizze a szegmentálást.
6. Hozzon létre minőségi Ground Truth.
7. Külön képzési, érvényesítési és esetleg tesztadatok.
8. Az első modell betanítása.
9. Tesztelje korábban nem használt oldalakon és egyéni írnokokon.
10. Egészítse ki a Ground Truth-t, különösen akkor, ha a modell meghibásodik.
11. Tanítsa újra a modellt.
12. Ha a minőség megfelel a projekt céljának, alkalmazza azt a dokumentum többi részére.

Ennek az iteratív megközelítésnek van egy másik fontos előnye is. A projekt eredménye nem csak egy betanított HTR modell. Ezenkívül létrehoz egy ellenőrzött Ground Truth korpuszt, amely megőrizhető, publikálható, felhasználható jövőbeli modellek betanításához vagy más adatkészletekkel kombinálható. Ezért hosszú távon egy jól elkészített Ground Truth értékesebb lehet, mint a HTR modell egy adott változata, amelyet később egy műszakilag fejlettebb megoldás válthat fel.