HTR · 02

Gyakorlati útmutató: az első HTR-modell betanítása

Megjelent: Frissítve: Kiadó: Vestigia Scriptorium

Saját kézírásos szövegfelismerő (HTR) modell létrehozása nem igényel programozási vagy gépi tanulási ismereteket. Az alapelv az, hogy a rendszert megfelelő számú kézírássor képpel, azok helyes átírásával együtt mutassuk be. Ez a pár – a dokumentum képe és annak ellenőrzött átírása – alkotja az úgynevezett Ground Truth (GT), vagyis azt a referenciaadatot, amelyből a modell tanul. [1]

A következő eljárás elsősorban a Transkribus-re összpontosít, mivel lehetővé teszi a teljes folyamat grafikus környezetben történő végrehajtását. Ugyanezt az alapelvet alkalmazzák azonban a nyílt forráskódú eszközök is, mint például a eScriptorium a Kraken felismerő rendszerrel. [2]

1. Először határozza meg az anyagot

Mielőtt elkezdené a képzési adatok létrehozását, jó ötlet meghatározni, hogy a jövőbeli modellnek mit kell tudnia olvasni. A 18. századi cseh közigazgatási anyakönyvekhez készült modell például más problémát old meg, mint a 20. század eleji személyes levelezés modellje.

Az első kísérlethez előnyös egy viszonylag homogén halmazt választani:

  • dokumentumok körülbelül ugyanebből az időszakból,
  • ugyanaz a nyelv,
  • hasonló kézírás,
  • lehetőleg egy írnok vagy kevés írástudó,
  • minőségileg hasonló képek.

Minél változatosabb anyagot mutatunk be a modellhez, általában annál több tanítási adatra van szükségünk. Ezért a Transkribus azt javasolja, hogy a betanítókészlet különböző típusú kézírást, nyelveket és egyéb jellemzőket képviseljen, amelyeket a modellnek később fel kell ismernie. [3]

2. Válassza ki a reprezentatív oldalakat

Nem tanácsos egyszerűen a könyv első néhány tucat oldalát átvenni. Jobb, ha olyan oldalakat választunk, amelyek azt az anyagot reprezentálják, amelyen később dolgozunk.

Például, ha egy archív kötet közös bejegyzéseket, táblázatokat, címsorokat, széljegyzeteket és több különböző írnokot tartalmaz, akkor előre el kell döntenünk, hogy ezek közül az elemek közül melyiket kezelje a modell.

Az első modellhez nem szükséges több száz oldalt előkészíteni. A jelenlegi Transkribus dokumentáció hozzávetőlegesen 5000-15000 szót sorol fel az anyag jellegétől függően, ami nagyjából 25-75 oldalnak felel meg. [4] A kéziratok esetében a szükséges adatok mennyisége elsősorban azok változékonyságától függ. A Transkribus újabb utasításai körülbelül 10 000 szót jelölnek meg tájékoztató jellegű leosztásonként ("kéz"). [1]

Ezek a számok tájékoztató jellegűek, nem pedig rögzített határértékek.

3. Először próbáljon ki egy meglévő modellt

Saját modell elkészítése előtt célszerű ellenőrizni, hogy van-e már az adott anyaghoz megfelelő modell. A Transkribus nyilvános modelleket kínál mind a fejlesztők, mind a felhasználói közösség által. Kereshetők például nyelv, időszak vagy írástípus szerint. [5]

Előfordulhat, hogy a meglévő modell nem nyújt tökéletes átírást. Ha azonban használható alapot teremt, akkor jelentősen felgyorsíthatja a Ground Truth elkészítését: a teljes oldal manuális átírása helyett csak az automatikusan generált átírást javítjuk.

4. Elemezze az oldal elrendezését

A HTR rendszernek tudnia kell, hogy az egyes szövegsorok hol találhatók az oldalon. Ezért a szövegfelismerést szegmentálás vagy elrendezés elemzés előzi meg.

Egy normál oldal esetében a rendszer általában automatikusan létrehozza a szövegterületeket és az úgynevezett alapvonalakat – referenciavonalakat az egyes szövegsorok mentén. Ezeket ellenőrizni kell.

A rosszul elhelyezett, összevont vagy hiányzó sorok negatívan befolyásolhatják a tanítási adatokat. A Transkribus kifejezetten rámutat arra, hogy a minőségi modell létrehozásakor fontos az alapvonalak helyessége. [6]

5. Készítsen pontos átírást

Most jön az egész folyamat legmunkaigényesebb része.

Minden sornak megfelelő szöveges átírással kell rendelkeznie. Létrehozhatjuk manuálisan, vagy először egy meglévő HTR modellt használhatunk, majd javíthatjuk az eredményt.

A sebességnél fontosabb a pontosság és következetesség. A modell nem ismeri fel, hogy a Ground Truth hibája emberi elírás. A hibás átírás egyszerűen képzési információ. [1]

A kiterjedtebb átírás megkezdése előtt ezért ajánlatos egyszerű átírási szabályokat létrehozni. Például el kell dönteni:

  • , hogy megtartjuk-e az eredeti írásmódot,
  • hogyan írunk nagy- és kisbetűket,
  • hogyan kezeljük a rövidítéseket,
  • , hogy bővítjük-e a rövidített űrlapokat,
  • hogyan írjuk az írásjeleket,
  • hogyan kezeljük az áthúzott vagy hozzáadott szöveget,
  • megőrizzük-e a történeti írásjeleket.

Az átírás következetes módja általában fontosabb a modell betanítása szempontjából, mint a szövegmodernizálás.

6. Az ellenőrzött oldalak megjelölése Ground Truth

Egy oldalt csak akkor tekintünk Ground Truth-nek, ha ellenőriztük mind az átírását, mind a szegmentálását.

A Transkribus-ben az így ellenőrzött oldalak Ground Truth állapothoz rendelhetők. Ezt követően ezekből az ellenőrzött adatokból létrehozunk egy képzési és érvényesítési készletet. [1]

Hasznos, ha nem tekintjük az automatikus átírást Ground Truth-nek, csak azért, mert „elég jól néz ki”. Még viszonylag kis mennyiségű szisztematikus hiba is megtaníthatja a modellt egy nemkívánatos átírási mintára.

7. Ossza fel az adatokat képzésre és érvényesítésre

Egy modellt nem szabad csak azokon az oldalakon értékelni, amelyekről tanult. Ezért a Ground Truth egy részét ellenőrző készletként félretesszük.

A Transkribus körülbelül 90%-os adatszolgáltatást ajánl a tanításhez és 10%-ot az érvényesítéshez. [1] [3]

Tehát ha van például 50 jó minőségű átírt oldalunk, akkor nagyjából a következőket használhatjuk:

45 oldal → tanítási adatok
5 oldal → érvényesítési adatok

Az érvényesítési oldalaknak reprezentatívnak kell lenniük. Például, ha dokumentumainkban több leíró szerepel, akkor ne csak a legolvashatóbbakból építsük fel az érvényesítő készletet. [3]

8. Fontolja meg az alapmodell használatát

Nem kell mindig a nulláról tanítanunk a modellt.

Ha létezik hasonló nyelvű, korszakú és típusú kéziratra épített modell, az alapmodellként használható, és a saját adataihoz adaptálható. Ez az eljárás, amelyet általában finomhangolásnak neveznek, csökkentheti a szükséges adatok mennyiségét és javíthatja az eredményeket. [6]

Hasonló elvet kínál a eScriptorium / Kraken is, ahol a meglévő modell saját adatokon tovább képezhető. [2]

Kezdő számára ezért célszerű először egy megfelelő alapmodellt kipróbálni, és csak szükség esetén a kezdetektől kísérletezni a tanítássel.

9. Kezdje el a tanítást

Az adatok előkészítése után létrehozhat egy új szövegfelismerési modellt a Transkribus alkalmazásban, kiválaszthatja a képzési és érvényesítési adatokat, és opcionálisan egy alapmodellt, és elkezdheti a képzést. [3]

Maga a számítás már automatikusan fut. Tehát egy kezdőnek nem kell neurális hálózatot felállítania vagy saját algoritmust programoznia.

Az eredmény egy olyan modell, amely a Ground Truth-ben ábrázolt kézírásra specializálódott.

10. Ellenőrizze a CER

A HTR modell minőségének egyik alapvető mutatója a Character Error Rate (CER), azaz a karakterszintű hibaarány.

Egyszerűen fogalmazva, a CER azt fejezi ki, hogy hány karakteres műveletre van szükség ahhoz, hogy az automatikus átírás megfeleljen a megfelelő referenciaátírásnak. Ezért érvényes:

alsó CER = pontosabb felismerés.

CER 10%, például nem egyszerűen azt jelenti, hogy "90%-ban helyes szavak". Ez egy metrika, amely a referencia és a felismert szöveg karakterei közötti különbségeken alapul.

A A Transkribus a CER 10% alatti értéket tartalmazza a keresés és a további elemzés általánosan alkalmazható eredményeként; 5% körüli vagy annál kisebb értékek érhetők el egy jól modellezett, koherens kézírás esetén. [1] [6]

Maga a szám azonban nem az egyetlen kritérium. Az archiválási munkáknál fontos figyelembe venni a hibák természetét is. Például a modell megbízhatóan képes olvasni a közönséges szöveget, de szisztematikusan pontosan hibázik a személy- és helynevekben, számokban vagy rövidítésekben, amelyek elengedhetetlenek a történeti kutatáshoz.

11. Próbálja ki a modellt korábban nem használt oldalakon

A modell betanítása után válasszon ki néhány olyan oldalt, amely nem volt része a betanítási vagy érvényesítési készletnek, és hajtsa végre az automatikus felismerést.

Ez gyakorlatiasabb választ ad a kérdésre:

"Mennyire fog jól teljesíteni ez a modell más dokumentumokon?"

A Transkribus útmutató egy korábban nem látott anyagon végzett tesztet is javasol. [1]

Ha a modell lényegesen rosszabbul teljesít az új oldalakon, mint az érvényesítési adatokon, a probléma lehet például a Ground Truth nem reprezentatív kiválasztása vagy a kéziratok túl sokfélesége.

12. Javítsa ki a hibákat és hozzon létre továbbiakat Ground Truth

Előfordulhat, hogy az első modell nem végleges.

A gyakorlati eljárás a következőképpen nézhet ki:

Ground Truth → első modell → további oldalak automatikus átírása → kézi javítás → új Ground Truth → új képzés → jobb modell

A kiváló minőségű tanítási adatok iteratív bővítése a saját HTR modell fejlesztésének egyik alapvető módja. [7]

Ugyanakkor fontos felhívni a figyelmet egy gyakori hibára: az automatikusan felismert szöveg javítása önmagában nem képezi automatikusan át a modellt. A javított oldalakat bele kell foglalni az új tanítási adatokba, és újabb tanításfutást kell indítani. [8]

Egyszerű első kísérlet

Egy kezdőnek nem kell azonnal digitalizálnia a teljes archív gyűjteményt. Jobb egy kis kontrollált kísérlettel kezdeni.

Vegyünk például egy kéziratos könyvet, többnyire egy írnokkal. Körülbelül 25-50 reprezentatív oldalt készítünk belőle. Szegmentálást végzünk, kijavítjuk az alapvonalakat és pontos átírást készítünk.

Ekkor az adatok nagy részét tanításre, körülbelül tizedét pedig érvényesítésre használjuk. Ha van megfelelő nyilvános modell egy hasonló nyelvre, korszakra és kézírásra, akkor azt vesszük alapul.

Edzés után még néhány, még nem használt oldalon kipróbáljuk saját modellünket.

A hibákat nem csak mechanikusan javítjuk. Az okukat követjük:

Minden karakternél hibázik a modell?
Valószínűleg több vagy jobb Ground Truth adatra van szükségünk.

Különösen gyengén teljesít egy leírónál?
Ez a kézírás alulreprezentált lehet a betanítási adatokban.

Hibákat ejt a sorhatároknál vagy egyesíti a szöveget?
A probléma a szegmentációval és az alapvonalakkal kapcsolatos.

Szisztematikusan félre ismer egy adott karaktert?
Célszerű ellenőrizni az átírás konzisztenciáját a Ground Truth nyelven.

A CER jó, de a modell hibás az új dokumentumokon?
A képzési és érvényesítési adatok valószínűleg nem reprezentálják kellőképpen a valós anyagot.

Csak ezen értékelés után van értelme további javított oldalak hozzáadásának és a modell ismételt betanításának.

Egy ilyen eljárásnak van egy jelentős előnye: az első kísérletben megalkotott alapigazság nem elpazarolt munka. Ez egy hosszú távon használható adatbázis, amely fokozatosan bővíthető és felhasználható a modell további verzióinak elkészítésekor.

Felhasznált források

[1]Transkribus : How to train a model in Transkribus, 2025.10.22.
https://www.transkribus.org/blog/how-to-train-a-text-recognition-model-in-transkribus

[2]eScriptorium Dokumentáció: Train models.
https://escriptorium-tutorial.readthedocs.io/en/latest/train/

[3]Transkribus Súgó: Model Setup and Training.
https://help.transkribus.org/model-setup-and-training

[4]Transkribus Súgó: How do I train a model?
https://help.transkribus.org/how-do-i-train-a-model

[5]Transkribus Súgó: Public Models.
https://help.transkribus.org/public-models

[6]READ-COOP: How to improve the CER of your model, 2024.04.16.
https://blog.transkribus.org/en/how-to-improve-the-cer-of-your-model

[7]READ-COOP: How to retrain a model in Transkribus, 2024.08.11.
https://blog.transkribus.org/en/how-to-retrain-a-model-in-transkribus

[8]Transkribus Súgó: Training Text Recognition Models.
https://help.transkribus.org/training-text-recognition-models