ΕΛ/ΛΑΚ | creativecommons.gr | mycontent.ellak.gr |
freedom

Τα ανοιχτά δεδομένα είναι ένα πεδίο όπου η Ελλάδα μπορεί να επηρεάσει την εξέλιξη της ΤΝ

Η Ελλάδα δεν μπορεί να ανταγωνιστεί τις ΗΠΑ και την Κίνα σε υπολογιστική ισχύ, μπορεί όμως να μετατρέψει τη γλώσσα, τη δημόσια γνώση, την επιστήμη και τον πολιτισμό της σε ανοιχτή υποδομή για την Τεχνητή Νοημοσύνη

Η παγκόσμια συζήτηση για την Τεχνητή Νοημοσύνη επικεντρώνεται συνήθως στα μεγαλύτερα μοντέλα, στα ακριβότερα κέντρα δεδομένων και στους ισχυρότερους επεξεργαστές. Με αυτούς τους όρους, μια χώρα του μεγέθους της Ελλάδας δεν μπορεί να ανταγωνιστεί τις Ηνωμένες Πολιτείες ή την Κίνα. Ούτε χρειάζεται να προσπαθήσει.

Υπάρχει όμως ένα άλλο πεδίο στο οποίο το μέγεθος της οικονομίας δεν είναι ο καθοριστικός παράγοντας: τα δεδομένα. Η ποιότητα, η προέλευση, η γλωσσική ποικιλία, η τεκμηρίωση και η δυνατότητα νόμιμης επαναχρησιμοποίησης των δεδομένων αποκτούν όλο και μεγαλύτερη σημασία όσο η ΤΝ περνά από τα γενικά μοντέλα στις πραγματικές εφαρμογές.

Εδώ η Ελλάδα διαθέτει ένα συγκριτικό πλεονέκτημα που μέχρι σήμερα αξιοποιεί ελάχιστα.

Από τα δημόσια αρχεία σε υποδομή ΤΝ

Η Ελλάδα παράγει καθημερινά τεράστιες ποσότητες δημόσιας γνώσης. Η Διαύγεια, η νομοθεσία, τα πρακτικά της Βουλής, οι δημόσιες διαβουλεύσεις, τα πανεπιστημιακά αποθετήρια, οι διδακτορικές διατριβές, τα σχολικά βιβλία, οι στατιστικές σειρές, τα γεωχωρικά δεδομένα, τα δεδομένα περιβάλλοντος και μεταφορών και οι ψηφιοποιημένες συλλογές πολιτιστικών φορέων αποτελούν ένα μεγάλο ελληνικό απόθεμα γνώσης.

Το γεγονός όμως ότι ένα έγγραφο βρίσκεται στο Διαδίκτυο δεν σημαίνει ότι αποτελεί χρήσιμο ανοιχτό δεδομένο για την ΤΝ. Ένα σαρωμένο κείμενο χωρίς δομή, μεταδεδομένα, σταθερό αναγνωριστικό και σαφείς όρους επαναχρησιμοποίησης έχει περιορισμένη αξία.

Για να αποκτήσει πραγματική αξία πρέπει να μετατραπεί σε μηχαναγνώσιμο υλικό, να καθαριστεί, να τεκμηριωθεί, να αποκτήσει σαφή προέλευση και έκδοση, να διατεθεί μέσω ανοικτών μορφότυπων και APIs και, όπου επιτρέπεται, να συνοδεύεται από ανοικτή άδεια.

Αυτή ακριβώς είναι η διαφορά ανάμεσα στην απλή ψηφιοποίηση και στη δημιουργία δημόσιας υποδομής δεδομένων.

Το glossAPI δείχνει ότι αυτό μπορεί ήδη να γίνει

Το glossAPI του Οργανισμού Ανοιχτών Τεχνολογιών ΕΕΛΛΑΚ αποτελεί ένα πρακτικό παράδειγμα αυτής της μετάβασης. Δεν δημιουργεί απλώς μια ακόμη συλλογή εγγράφων. Αναπτύσσει μια επαναχρησιμοποιήσιμη διαδικασία που μετατρέπει ετερογενείς πηγές, μεταξύ άλλων αρχεία, σε δομημένα σώματα κειμένων κατάλληλα για επεξεργασία φυσικής γλώσσας, αναζήτηση, ανάκτηση γνώσης και ανάπτυξη εφαρμογών ΤΝ.

Στο Hugging Face διατίθενται ήδη δεκάδες συλλογές ελληνικών δεδομένων από διαφορετικά πεδία. Ιδιαίτερα σημαντική είναι η επεξεργασία εκατομμυρίων πράξεων της Διαύγειας. Έτσι, ένα σύστημα που δημιουργήθηκε αρχικά για τη διαφάνεια της διοίκησης μπορεί να αποκτήσει μια δεύτερη δημόσια αξία: να αποτελέσει μέρος της γλωσσικής και διοικητικής υποδομής της ελληνικής ΤΝ.

Το παράδειγμα έχει σημασία επειδή δείχνει ότι το δύσκολο μέρος δεν είναι πάντοτε η εκπαίδευση ενός ακόμη μοντέλου. Συχνά είναι η επίμονη εργασία πριν από αυτήν: συλλογή, καθαρισμός, μετατροπή, τεκμηρίωση, έλεγχος ποιότητας και αποσαφήνιση των δικαιωμάτων επαναχρησιμοποίησης.

Η ελληνική γλώσσα δεν θα καλυφθεί αυτόματα από την αγορά

Τα μεγάλα διεθνή μοντέλα εκπαιδεύονται κυρίως εκεί όπου υπάρχουν μεγάλες ποσότητες εύκολα διαθέσιμου ψηφιακού υλικού. Οι γλώσσες μικρότερων αγορών έχουν αναπόφευκτα μικρότερη παρουσία.

Για την Ελλάδα αυτό δεν είναι μόνο γλωσσικό ζήτημα. Μέσα στα ελληνικά κείμενα βρίσκεται κωδικοποιημένος ο τρόπος λειτουργίας του κράτους, το δίκαιο, η εκπαίδευση, η ιστορία, η επιστημονική παραγωγή, ο πολιτισμός και η κοινωνική εμπειρία της χώρας.

Αν αυτό το υλικό παραμένει κλεισμένο σε αρχεία, ασύνδετες βάσεις και αποθετήρια χωρίς κοινά πρότυπα, δεν μπορεί να αξιοποιηθεί συστηματικά. Αντίθετα, αν μετατραπεί σε αξιόπιστα και τεκμηριωμένα ανοιχτά σύνολα δεδομένων, μπορεί να χρησιμοποιηθεί από πανεπιστήμια, ερευνητικές ομάδες, νεοφυείς επιχειρήσεις, δημόσιους φορείς και διεθνή έργα ανοικτής ΤΝ.

Έτσι μια μικρή χώρα αποκτά δυνατότητα επιρροής πολύ μεγαλύτερη από το οικονομικό της μέγεθος. Δεν χρηματοδοτεί το μεγαλύτερο μοντέλο. Βελτιώνει τα δεδομένα πάνω στα οποία μπορούν να εκπαιδευτούν, να προσαρμοστούν και να αξιολογηθούν πολλά μοντέλα.

Η ευρωπαϊκή πολιτική κινείται ήδη προς αυτή την κατεύθυνση

Η Ευρωπαϊκή Ένωση έχει αρχίσει να αντιμετωπίζει τα δεδομένα ως κρίσιμη υποδομή της ΤΝ. Η νομοθεσία για τα ανοιχτά δεδομένα προβλέπει ειδική κατηγορία δεδομένων υψηλής αξίας, τα οποία πρέπει να είναι διαθέσιμα δωρεάν, σε μηχαναγνώσιμη μορφή, μέσω APIs και, όπου χρειάζεται, για μαζική λήψη.

Η ευρωπαϊκή Data Union Strategy πηγαίνει ακόμη πιο μακριά, συνδέοντας άμεσα τη μεγαλύτερη διαθεσιμότητα ποιοτικών δεδομένων με την ανάπτυξη της ευρωπαϊκής ΤΝ. Παράλληλα αναπτύσσονται κοινοί ευρωπαϊκοί χώροι δεδομένων για τη δημόσια διοίκηση, την έρευνα, την υγεία, τη γεωργία, τον πολιτισμό, τη γλώσσα, την κινητικότητα και άλλους τομείς.

Η Ελλάδα επομένως δεν χρειάζεται να σχεδιάσει μια απομονωμένη εθνική πολιτική. Χρειάζεται να συνδέσει το δικό της απόθεμα δεδομένων με αυτή την ευρωπαϊκή αρχιτεκτονική.

Μια εθνική πολιτική για δεδομένα έτοιμα για ΤΝ

Το πρώτο βήμα είναι να θεωρήσουμε τα δημόσια δεδομένα υποδομή και όχι παραπροϊόν της διοίκησης. Κάθε σημαντικό σύνολο δεδομένων πρέπει να έχει υπεύθυνο φορέα, σταθερή χρηματοδότηση συντήρησης, σαφή άδεια, τεκμηρίωση, ιστορικό εκδόσεων, ανοικτό μορφότυπο και προγραμματιστική διεπαφή όπου αυτό είναι χρήσιμο.

Το δεύτερο είναι να καθιερωθεί η αρχή ότι η δημόσια χρηματοδότηση πρέπει, όπου δεν υπάρχουν περιορισμοί προστασίας προσωπικών δεδομένων, ασφάλειας ή δικαιωμάτων τρίτων, να παράγει δημόσια επαναχρησιμοποιήσιμα δεδομένα.

Το τρίτο είναι να δημιουργηθεί μόνιμη δυνατότητα μετατροπής των ελληνικών δημόσιων συλλογών σε ποιοτικά δεδομένα κατάλληλα για ΤΝ, αξιοποιώντας υποδομές όπως το glossAPI αντί να ξεκινούν διαρκώς νέα αποσπασματικά έργα.

Ανοιχτά δεδομένα βεβαίως δεν σημαίνει ότι όλα τα δεδομένα πρέπει να δημοσιοποιούνται. Τα προσωπικά, ευαίσθητα ή διαβαθμισμένα δεδομένα απαιτούν διαφορετική διακυβέρνηση. Η ανοιχτότητα πρέπει να εφαρμόζεται εκεί όπου είναι νόμιμη και κοινωνικά επωφελής, με προστασία της ιδιωτικότητας από τον σχεδιασμό.

Από καταναλωτής ΤΝ σε παραγωγό δημόσιας ψηφιακής αξίας

Η Ελλάδα δύσκολα θα καθορίσει ποιος θα κατασκευάσει τον επόμενο κορυφαίο επεξεργαστή ή ποια εταιρεία θα εκπαιδεύσει το μεγαλύτερο παγκόσμιο μοντέλο. Μπορεί όμως να επηρεάσει το ποια ελληνική γνώση θα υπάρχει μέσα στο οικοσύστημα της ΤΝ, με ποιους όρους θα είναι διαθέσιμη και ποιος θα μπορεί να τη χρησιμοποιήσει.

Αυτό είναι ένα ρεαλιστικό πεδίο ψηφιακής κυριαρχίας.

Η επιλογή είναι απλή. Μπορούμε να αφήσουμε εκατομμύρια δημόσια έγγραφα, επιστημονικές εργασίες και πολιτιστικές συλλογές εγκλωβισμένα σε αποθετήρια και κλειστά αρχεία. Ή μπορούμε να τα μετατρέψουμε σε ένα ανοιχτό, ποιοτικό και διαλειτουργικό ελληνικό απόθεμα γνώσης που θα τροφοδοτεί την ευρωπαϊκή και διεθνή ΤΝ.

Στη δεύτερη περίπτωση, η Ελλάδα δεν θα είναι απλώς χρήστης των μοντέλων που κατασκευάζουν άλλοι. Θα συνεισφέρει στην πρώτη ύλη από την οποία θα δημιουργούνται τα επόμενα.

Πηγές

  1. European Commission, European legislation on open data: Το ευρωπαϊκό πλαίσιο για την επαναχρησιμοποίηση δημόσιων δεδομένων ορίζει τα δεδομένα υψηλής αξίας ως κρίσιμες πηγές για νέες υπηρεσίες και για την ανάπτυξη εφαρμογών ΤΝ και προβλέπει μηχαναγνώσιμη διάθεση και APIs: https://digital-strategy.ec.europa.eu/en/policies/legislation-open-data
  2. Commission Implementing Regulation (EU) 2023/138 on High-Value Datasets: Καθορίζει συγκεκριμένα δεδομένα υψηλής αξίας και απαιτεί τη διάθεσή τους μέσω APIs, ανοικτών μηχαναγνώσιμων μορφότυπων και, όπου προβλέπεται, μαζικής λήψης: https://eur-lex.europa.eu/eli/reg_impl/2023/138,
  3. European Commission, Data Union Strategy, Unlocking data for AI: Η νέα ευρωπαϊκή στρατηγική συνδέει ρητά την αύξηση της πρόσβασης σε ποιοτικά δεδομένα με την ανάπτυξη και την ανταγωνιστικότητα της ευρωπαϊκής ΤΝ: https://digital-strategy.ec.europa.eu/en/library/data-union-strategy-unlocking-data-ai,
  4. European Commission, Common European Data Spaces: Παρουσιάζει την ευρωπαϊκή αρχιτεκτονική κοινών χώρων δεδομένων σε τομείς όπως δημόσια διοίκηση, έρευνα, γεωργία, πολιτισμός, γλώσσα, κινητικότητα και υγεία: https://digital-strategy.ec.europa.eu/en/policies/data-spaces,
  5. ΕΕΛΛΑΚ, glossAPI, Greek Dataset Production from PDF+: Ανοιχτός αγωγός επεξεργασίας εγγράφων για τη μετατροπή κειμένων και άλλων πηγών σε δομημένα, επαναχρησιμοποιήσιμα σώματα κειμένων, με κώδικα υπό EUPL 1.2: https://github.com/eellak/glossAPI,
  6. glossAPI, Diavgeia Greek Government Transparency Decisions: Ανοιχτό ελληνικό σύνολο δεδομένων που μετατρέπει πράξεις και μεταδεδομένα της Διαύγειας σε δομημένο σώμα κειμένων για επεξεργασία φυσικής γλώσσας, έρευνα και εφαρμογές ΤΝ: https://huggingface.co/datasets/glossAPI/diavgeia.

Leave a Comment