AI w indeksacji

Narzędzia AI coraz prężniej się rozwijają i jest na nie duże parcie. Postanowiłem znowu wykonać pewien test związany z nimi i genealogią.

Spróbowałem indeksacji metryk ze skanów aktów. Użyłem Google Gemini, gdyż Chat GPT przy wcześniejszych próbach czytania metryk dużo zmyślał. Poniżej prezentuję wyniki 2 eksperymentów.


przykład 1 - metryki urodzeń z parafii Wiskitki.

Na próbę wziąłem jeden skan urodzeń z 1812 roku. W genetece ten rocznik jest zindeksowany. Początek wygląda tak:



Użyłem następującego polecenia:

Masz tutaj link do polskich aktów urodzeń z wiskitek

https://metryki.genealodzy.pl/index.php?op=pg&id=116&sy=1812&kt=1&plik=001-003.jpg

Wypisz mi stamtąd dane z poszczególnych aktów. Dane mają być w pliku xlsx.

rok, numer aktu, data, imię urodzonego, nazwisko, imię ojca, imię matki, nazwisko panieńskie matki

jeżeli jakiejś danej nie ma to zostaw puste miejsce.


Niestety zapomniałem dodać pole o miejscowości. Gemini od razu mnie poinformował, że muszę mu wklejać tekst bądź pliki ze zdjęciami/skanami. Nie może czytać z linków.




Powtórzyłem próbę wklejając mu zdjęcie z powyższego linka. Wynik był następujący:



Otrzymałem swój plik xlsx z danymi. Jak widać z rokiem, numerem aktu oraz imionami nie było problemu. Gorzej z datą. Gemini wziął datę z początku aktu, gdzie odnotowano moment zgłoszenia. Dalej w treści były podane informacje, że np. pierwsza osoba urodziła się 29.12.1811. Jej urodzenie było zgłoszone 01.01.1812.
Więcej błędów było przy nazwiskach. Pierwsze nazwisko źle odczytane, drugie również (przynajmniej pierwsza część), a trzecie jest ok.
Podobnie w nazwiskach panieńskich matek, pierwsze jest z błędem (tutaj źle odmienione), a pozostałe akurat wyszły poprawnie.

W każdym razie otrzymałem plik xlsx, z którego łatwo przerzucić dane do szablonu indeksów, jaki udostępnia PTG: LINK

Była to jedna próba na małym zbiorze danych. Zobaczmy kolejną.



przykład 2 - łacińskie metryki urodzeń z parafii Parzęczew.


Tym razem użyłem skanów z familysearch.org. Wziąłem dwie pierwsze strony księgi urodzeń od 1799 roku tam gdzie była numeracja. Było tam 16 aktów.




Użyłem następującego polecenia:

Przeanalizuj i odczytaj akty urodzeń z załączonych zdjęć, a następnie przygotuj plik XLSX, który będę mógł pobrać. Dane ze zdjęć przepisz chronologicznie wg plików.

Zasady tworzenia pliku:

Nagłówki kolumn: Miejscowość, Rok (YYYY),Data (MM.DD), Pełna data (YYYY.MM.DD), Imię urodzonego, Nazwisko urodzonego, Imię ojca, Imię matki, Nazwisko matki, informacje o świadkach

Jeżeli nie ma jakiejś wartości to zostawiaj puste miejsce.


Formatowanie arkusza: Estetyczna tabela w formacie Excel z nagłówkiem, siatką linii, dopasowaną szerokością kolumn i wyśrodkowaniem dla daty oraz wieku.

Po paru chwilach otrzymałem wyniki:




Pierwsze co mi się rzuciło w oczy to przepisanie nazwiska do kol. nazwisko panieńskie matki. Poprosiłem Geminiego o korektę:


Wyniki po poprawkach:




oraz moje indeksy, które kiedyś przygotowałem (dla porównania):




Większy zbiór danych to i więcej błędów. Dane w kolumnie Rok zostały poprawnie odczytane. Tutaj akurat było kilka luzem dodanych aktów z innych roczników. AI sobie z tym poradził. Dalej miesiąc i dzień - miesiące dobrze odczytane, ale niektóre dni z błędami.

Tym razem pojawiły się również błędy w imionach. Nawet w 1 rekordzie: Franciszek, zamiast Dominika. Widać, że imię księdza zostało wpisane. To akurat był trudniejszy przykład, gdyż imię dziecka wpisane jest w prawym górnym rogu aktu i to jest mało czytelne. Drugi większy błąd to  zrobienie bliźniaków z dziewczynki, którą ochrzczono jako Józefa Marianna (ostatni rekord).

Potem przyszła kolej na nazwiska. Tutaj ponownie błędy, jak w pierwszych przykładzie.  Analogicznie nazwiska panieńskie matek. Widać, że AI nie do końca jeszcze sobie radzi z nazwami własnymi, nazwiskami etc. Błędy pojawiły się w nazwach miejscowości. Ostatnia kolumna to już powielenie błędów, które wymieniłem.

W każdym razie, w krótkim odstępie czasu otrzymałem plik z wynikami. Sam przepisując te dane robiłbym to dłużej.

Mając taki zestaw danych z błędami nasuwa się pytanie, czy warto go generować, a potem sprawdzać ze źródłem, czy może dalej indeksować ręcznie?

Powyżej pokazałem tylko dwa przykłady. U siebie robiłem więcej prób. Wydaje mi się, że warto skorzystać z AI, przynajmniej przy łacińskich aktach, gdzie danych jest mało, mają prostszą formę, więc błędów będzie mniej. Ważna jest także czytelność aktu, gdyż każdy był pisany ręcznie. Tutaj niestety nie mamy wpływu na jakość. 
Najwięcej problemów zaobserwowałem z nazwami własnymi np. miejscowości, nazwiska. Tutaj nie ma logiki i zasady, jak przy imionach. Te z resztą też ewoluowały przez lata i się zmieniały nie zachowując oryginalnej formy.
Ważne jest jeszcze, aby dobrze napisać polecenie, które przygotuje nam dane. Źle skonstruowane zapytanie wygeneruje dodatkowe błędy. 
Przeglądając taki wygenerowany plik i tak musimy go porównać ze skanem aktu i wyeliminować błędy. Jest to jednak szybsze niż przepisywanie od zera. Tym bardziej, że spora część danych jest poprawna. 
Tutaj też istotna jest biegłość indeksującego jeżeli chodzi o obsługę komputera i klawiatury. 
Indeksując kolejne metryki, przynajmniej te łacińskie, raczej użyję narzędzia AI, a potem ręcznie poprawię błędy. Może za jakiś czas, tych błędów będzie mniej, a indeksacja stanie się bardziej przystępna i szybsza.