Na Forum MT pojawiła się inicjatywa (KLIK) stworzenia jakiejś formy łatwego wyszukiwania tematów albo przeglądania spisów treści z poszczególnych lat.
Mamy zamiar zeskanować spisy treści a potem przetworzyć je w programie OCR na postać tekstową.
Ale pytanie: co dalej z tym zrobić? Jak z takich plików tekstowych stworzyć sensowną bazę danych, która umożliwi wyszukiwanie np. pojedynczych słów z tytułów, słów kluczowych itp.
Obecnie na stronie MT są dostępne skany archiwalnych artykułów z działu "Na Warsztacie" z lat 1956-1995 i mają być uzupełniane o kolejne. Także na Forum MT będą się pojawiały skany archiwalnych artykułów z innych działów, robione przez jednego z kolegów.
Ale wcześniej trzeba umieć je odnaleźć i stąd pomysł zrobienia czegoś, co ułatwi wyszukiwanie.
Można by to zrobić w prostej postaci wykazu numerów, z których można dotrzeć do spisu treści.
Przykład takiej formy: http://www.fonar.com.pl/audio/czasopism ... ndex_g.htm
Jednak ona nie umożliwia wyszukiwania - trzeba zajrzeć do każdego numeru aby coś znaleźć.
Mam więc prośbę dla osób zorientowanych w temacie baz danych o wskazówki. Nie jestem informatykiem, mam tylko ogólne pojęcie o relacyjnych bazach danych.
Chodzi o coś takiego: z zeskanowanych spisów treści tworzymy "coś", np. bazę zawierającą rekordy o określonych polach np.: rok, nr, tytuł artykułu, strona, typ artykułu (słowo kluczowe: np. Na Warsztacie, Klub Wynalazców itp.), drugie słowo kluczowe, link do skanu, uwagi dodatkowe.
Taka baza byłaby potem "pożywką", aby z poziomu przeglądarki www można było wyszukiwać informacje. Zapewne trzeba by do tego napisać jakiś skrypt, który zapewni wyszukiwanie informacji - nie mam o tym pojęcia, ale załóżmy, że ktoś to napisze.
Docelowo taka baza może mieć spory rozmiar, bo MT wydawany jest od 60 lat, co przy 12 numerach w roku daje ok. 700 spisów treści. Każdy spis, to ok. 30 artykułów, czyli razem ok. 20000 rekordów.
Na chwilę obecną interesuje nas stworzenie samej bazy: jaką ona powinna mieć formę, aby była uniwersalna, prosta do zrobienia i uzupełniania. Mógłbym np. importować spis treści (plik TXT po programie OCR) do Excela (1 wiersz = 1 pozycja spisu treści) i potem stworzyć dodatkowe pola - powstałaby baza dotycząca pojedynczego numeru.
Potem łączyć numery w roczniki itd. Dalej można taki plik np. wyeksportować do formatu CSV.
Nie wiem, jednak czy taki plik CSV będzie odpowiedni dla skryptu przeglądarki. Może trzeba się do tego zabrać w całkiem inny sposób?
Jak to zrobić z sensem?
Proszę o podpowiedzi i z góry dziękuję