Το GlossAPI μετατρέπει δημόσια διοικητικά έγγραφα σε υποδομή για την ελληνική Τεχνητή Νοημοσύνη
Για να είναι αξιόπιστα τα ελληνικά γλωσσικά μοντέλα χρειάζονται μεγάλα και ποιοτικά σώματα κειμένων στα ελληνικά, τέτοια που να αποτυπώνουν πώς πραγματικά “γράφει” και “αποφασίζει” η δημόσια διοίκηση, η νομοθεσία και η αυτοδιοίκηση.
Με αυτό το σκεπτικό, το GlossAPI, μια πρωτοβουλία του Οργανισμού Ανοιχτών Τεχνολογιών – ΕΕΛΛΑΚ, ολοκλήρωσε ένα σημαντικό τεχνικό ορόσημο: τη μαζική εξαγωγή, αποθήκευση, επεξεργασία και ανοιχτή διάθεση ενός μεγάλου σώματος κειμένων από τη «Διαύγεια».
Το αποτέλεσμα είναι ένα corpus περίπου 2,8 εκατομμυρίων επεξεργασμένων εγγράφων, που προέκυψε από ένα αρχικό σύνολο 3.101.551 αρχείων PDF και των αντίστοιχων JSON μεταδεδομένων τους. Συνολικού όγκου περίπου 1,26 TB, αποτελεί μία από τις σημαντικότερες μέχρι σήμερα προσπάθειες να μετατραπούν ελληνικά δημόσια διοικητικά έγγραφα σε επεξεργάσιμο και δομημένο κείμενο, αξιοποιήσιμο για εφαρμογές επεξεργασίας φυσικής γλώσσας και Τεχνητής Νοημοσύνης.
Γιατί η «Διαύγεια» είναι κρίσιμη πηγή για την ελληνική ΤΝ

Πέρα από αποθετήριο διοικητικών αποφάσεων, η «Διαύγεια» είναι ένα από τα πιο σημαντικά θεσμικά εργαλεία διαφάνειας του ελληνικού Δημοσίου. Από το 2010 και μετά, εκατομμύρια πράξεις υπουργείων, δήμων, περιφερειών και δημόσιων φορέων δημοσιεύονται εκεί με μοναδικό αναγνωριστικό και ανοιχτή πρόσβαση.
Έτσι έχει συσσωρευτεί τεράστιος όγκος ελληνικού διοικητικού λόγου: αποφάσεις ανάληψης υποχρέωσης, μεταβολές ανθρώπινου δυναμικού, εγκρίσεις, συμβάσεις, κανονιστικές πράξεις, πράξεις συλλογικών οργάνων, προκηρύξεις, διορισμοί, δαπάνες και πλήθος άλλων εγγράφων που αποτυπώνουν την καθημερινή λειτουργία του κράτους.
Για την Τεχνητή Νοημοσύνη το υλικό αυτό έχει ιδιαίτερη αξία, καθώς μπορεί να τροφοδοτήσει την εκπαίδευση και την αξιολόγηση μοντέλων που κατανοούν τη διοικητική γλώσσα: μοντέλων που ταξινομούν έγγραφα, παράγουν περιλήψεις, εντοπίζουν οντότητες, βοηθούν στην ανωνυμοποίηση ευαίσθητων δεδομένων και υποστηρίζουν πιο διαφανείς δημόσιες υπηρεσίες. Με αυτή την έννοια, η «Διαύγεια» δεν έχει αξία μόνο ως εργαλείο λογοδοσίας· μπορεί να λειτουργήσει και ως υποδομή γνώσης για μια ανοιχτή, δημόσια και ελεγχόμενη ΤΝ στα ελληνικά.
Η τεχνική διαδικασία: από τα PDF στο καθαρό κείμενο
Η συλλογή και επεξεργασία εκατομμυρίων εγγράφων σε αυτή την κλίμακα απαιτεί σταθερή υποδομή, αυτοματοποίηση, έλεγχο σφαλμάτων και εργαλεία που αντέχουν μεγάλο όγκο ετερογενών αρχείων. Η ροή εργασίας της ομάδας του GlossAPI οργανώθηκε σε δύο φάσεις.
Η πρώτη αφορούσε τη μαζική εξαγωγή και αποθήκευση των δεδομένων. Η συλλογή έγινε μέσω του επίσημου OpenData API της «Διαύγειας», ενώ για τη διαχείριση του όγκου και την αξιοπιστία της διαδικασίας αξιοποιήθηκαν υποδομές Google Cloud Platform. Ολοκληρώθηκε τον Φεβρουάριο του 2026 με εξαιρετικά υψηλό ποσοστό επιτυχίας, της τάξης του 99,999%: μόλις 28 αποτυχημένες κλήσεις σε περίπου 3,1 εκατομμύρια έγγραφα.
Η δεύτερη φάση αφορούσε την επεξεργασία των PDF και την εξαγωγή του κειμένου. Χρησιμοποιήθηκε το εργαλείο που έχει αναπτύξει η ομάδα του GlossAPI και διατίθεται ως ανοιχτό λογισμικό στο αποθετήριο github.com/eellak/glossAPI. Ως σύστημα οπτικής αναγνώρισης χαρακτήρων ενσωματώθηκε το Rapid OCR, ώστε τα PDF να μετατραπούν σε δομημένο και επεξεργάσιμο κείμενο.
Όπως συμβαίνει σε κάθε μαζική επεξεργασία πραγματικών διοικητικών εγγράφων, ένα μέρος των αρχείων παρουσίασε τεχνικά προβλήματα: κάποια PDF ήταν κατεστραμμένα, άλλα είχαν μη τυποποιημένη κωδικοποίηση ή προβληματική εσωτερική δομή. Παρ’ όλα αυτά, περίπου 2,8 εκατομμύρια έγγραφα επεξεργάστηκαν επιτυχώς και είναι πλέον διαθέσιμα για περαιτέρω ανάλυση.
Τι δείχνει η ανάλυση του corpus
Η στατιστική εικόνα του συνόλου δεδομένων λέει αρκετά για το πώς παράγεται διοικητική πληροφορία στο ελληνικό Δημόσιο. Στο σύστημα της «Διαύγειας» εντοπίστηκαν 43 μοναδικοί τύποι αποφάσεων· από αυτούς οι 35 περιλαμβάνουν συνημμένα έγγραφα, ενώ 8 λειτουργούν ως γονικές οργανωτικές κατηγορίες χωρίς αρχεία. Στο ληφθέν dataset καταγράφηκαν 34 ενεργοί τύποι.
Η κατανομή είναι έντονα ανισοβαρής. Τρεις μόνο τύποι συγκεντρώνουν περίπου το 68% του συνολικού όγκου:
- Ανάληψη Υποχρέωσης, Β.2.2: 1.048.765 έγγραφα, 33,8%.
- Μεταβολή Ανθρώπινου Δυναμικού, Β.1.3: 675.896 έγγραφα, 21,8%.
- Εγκρίσεις, Αποφάσεις και Πράξεις, 2.4.7.1: 382.006 έγγραφα, 12,3%.
Ακολουθούν άλλες κατηγορίες, όπως εγκρίσεις δαπανών, κανονιστικές πράξεις, αναθέσεις, συμβάσεις, πράξεις συλλογικών οργάνων, προκηρύξεις και διοικητικές πράξεις της αυτοδιοίκησης.
Η κατανομή αυτή δείχνει ποιες μορφές διοικητικής πράξης κυριαρχούν στην καθημερινή παραγωγή του Δημοσίου, και ταυτόχρονα προσφέρει βάση για στοχευμένη ανάπτυξη μοντέλων. Ένα μοντέλο που εκπαιδεύεται σε τέτοιο υλικό δεν μαθαίνει γενικά «ελληνικά», αλλά τη συγκεκριμένη γλώσσα των δημόσιων αποφάσεων, των προμηθειών, των διοικητικών διαδικασιών και της θεσμικής τεκμηρίωσης.
Ένας σημαντικός τεχνικός περιορισμός
Κατά τη διάρκεια του έργου διαπιστώθηκε ένας κρίσιμος περιορισμός στο OpenData API της «Διαύγειας». Η αναζήτηση με βάση τα πεδία issueDate και submissionTimestamp φαίνεται να περιορίζεται από ένα κυλιόμενο χρονικό παράθυρο περίπου έξι μηνών.
Έτσι, το τρέχον dataset αποτυπώνει κυρίως την περίοδο Ιουλίου 2025 έως Φεβρουαρίου 2026 και δεν αποτελεί το πλήρες ιστορικό αρχείο της πλατφόρμας. Η απόσταση από το πλήρες αρχείο είναι μεγάλη: από το 2010 μέχρι σήμερα εκτιμάται ότι έχουν καταχωριστεί περίπου 73,8 εκατομμύρια αποφάσεις. Τα 3,1 εκατομμύρια συλλεγμένα έγγραφα και τα 2,8 εκατομμύρια επεξεργασμένα κείμενα είναι, επομένως, ένα πρώτο βήμα σε μια πολύ μεγαλύτερη προσπάθεια.
Το εύρημα αυτό αφορά και τη δημόσια πολιτική. Όταν τα δημόσια δεδομένα είναι προσβάσιμα μόνο μέσα από τεχνικούς περιορισμούς που δυσκολεύουν την πρόσβαση στο πλήρες ιστορικό, η ανοιχτότητα μένει μισή. Ουσιαστική ανοιχτότητα δεν σημαίνει απλώς δημοσίευση εγγράφων, αλλά και σταθερούς, τεκμηριωμένους και μηχανικά αξιοποιήσιμους τρόπους μαζικής πρόσβασης.
Ανοιχτή διάθεση στην ερευνητική και τεχνολογική κοινότητα
Το τελικό, καθαρισμένο και δομημένο σύνολο δεδομένων διατίθεται ελεύθερα στην πλατφόρμα Hugging Face, στο επίσημο αποθετήριο του GlossAPI: https://huggingface.co/datasets/glossAPI/diavgeia
Απευθύνεται σε ερευνητές, προγραμματιστές, γλωσσολόγους, μηχανικούς δεδομένων, ομάδες ΤΝ, δημόσιους φορείς και κοινότητες ανοιχτού λογισμικού που θέλουν να δουλέψουν πάνω στην ελληνική διοικητική γλώσσα.
Η χρησιμότητά του δεν σταματά στην εκπαίδευση μεγάλων γλωσσικών μοντέλων. Μπορεί να αξιοποιηθεί και για:
- αυτόματη ταξινόμηση διοικητικών εγγράφων,
- εξαγωγή οντοτήτων, όπως φορείς, ποσά, ημερομηνίες και ΑΔΑ,
- ανάλυση δημόσιων δαπανών και προμηθειών,
- εργαλεία αναζήτησης και ερωταποκρίσεων με παραπομπές,
- συστήματα περίληψης δημόσιων αποφάσεων,
- ανωνυμοποίηση και ψευδωνυμοποίηση ευαίσθητων δεδομένων,
- βελτίωση OCR και αξιολόγηση ελληνικών μοντέλων σε πραγματικά διοικητικά κείμενα.
Το σκεπτικό πίσω από τη διάθεση είναι ότι δεδομένα που παράγονται με δημόσιους πόρους οφείλουν, με σεβασμό στην προστασία των προσωπικών δεδομένων, να επιστρέφουν στην κοινωνία ως δημόσια γνώση και κοινό αγαθό.
Τα επόμενα βήματα
Η φάση που ολοκληρώθηκε ανοίγει τον δρόμο για την επόμενη. Το πρώτο ζητούμενο είναι να βρεθεί τρόπος ανάκτησης ενός αντιπροσωπευτικού συνόλου από ολόκληρο το ιστορικό αρχείο της «Διαύγειας», ώστε να γίνουν προσβάσιμες οι αποφάσεις από το 2010 και μετά με τρόπο σταθερό, επαναλήψιμο και τεχνικά βιώσιμο.
Παράλληλα χρειάζεται συνεχής βελτίωση του OCR pipeline. Τα παλαιότερα PDF, τα κακοσχηματισμένα αρχεία και οι διαφορετικές μορφές σάρωσης απαιτούν διαρκή βελτιστοποίηση· όσο μειώνεται το ποσοστό αποτυχίας, τόσο καλύτερη και πιο αντιπροσωπευτική γίνεται η συλλογή.
Πάνω σε αυτό το σώμα κειμένων μπορούν στη συνέχεια να αναπτυχθούν εξειδικευμένα ελληνικά μοντέλα και εργαλεία με συγκεκριμένη δημόσια αξία, αντί για γενικά μοντέλα χωρίς έλεγχο: εργαλεία που βοηθούν στη διαφάνεια, στην αναζήτηση δημόσιων πράξεων, στη σύνοψη αποφάσεων και στην υποστήριξη λειτουργών και πολιτών.
Καθοριστική, τέλος, είναι η τεκμηρίωση του dataset με σύγχρονες πρακτικές διαφάνειας: datasheets, περιγραφή μεθοδολογίας, γνωστούς περιορισμούς, στατιστικά ποιότητας, εκδόσεις και δυνατότητα αναπαραγωγής της διαδικασίας. Άλλωστε η ανοιχτή ΤΝ δεν εξαντλείται στον ανοιχτό κώδικα και τα ανοιχτά δεδομένα· περιλαμβάνει και την ανοιχτή τεκμηρίωση, που επιτρέπει σε άλλους να ελέγξουν, να βελτιώσουν και να επαναχρησιμοποιήσουν το έργο.
Από τη διαφάνεια στη δημόσια Τεχνητή Νοημοσύνη
Η δουλειά πάνω στα δεδομένα της «Διαύγειας» φέρνει στην επιφάνεια ένα ευρύτερο ζήτημα: η Ελλάδα διαθέτει ήδη τεράστιο δημόσιο γλωσσικό και διοικητικό απόθεμα. Το ερώτημα είναι αν αυτό θα μείνει κλειδωμένο σε PDF και αποσπασματικές αναζητήσεις ή αν θα γίνει ανοιχτή υποδομή για την επόμενη γενιά δημόσιων ψηφιακών υπηρεσιών.
Το GlossAPI επιδιώκει το δεύτερο: να μετατραπούν τα δημόσια έγγραφα σε ανοιχτά, τεκμηριωμένα και αξιοποιήσιμα σύνολα δεδομένων, ώστε η ελληνική γλώσσα να έχει θέση στην εποχή της ΤΝ και να στηρίζονται ανοιχτά μοντέλα που δεν εξαρτώνται αποκλειστικά από κλειστές πλατφόρμες. Ζητούμενο, τελικά, είναι μια δημόσια ΤΝ στην υπηρεσία της διαφάνειας, της λογοδοσίας και του κοινού συμφέροντος.
Η «Διαύγεια» υπήρξε ένα από τα σημαντικότερα βήματα θεσμικής διαφάνειας στη χώρα. Το επόμενο είναι να γίνει, με ανοιχτό και υπεύθυνο τρόπο, μέρος της δημόσιας υποδομής γνώσης για την ελληνική Τεχνητή Νοημοσύνη.
—
