ΕΛ/ΛΑΚ | creativecommons.gr | mycontent.ellak.gr |
freedom

Η μακριά ουρά δεν έχει εκπρόσωπο

Όταν η OpenAI δημοσίευσε το 2020 τα στοιχεία εκπαίδευσης του GPT-3, η Wikipedia αντιστοιχούσε σε περίπου 3 δισεκατομμύρια από τα 499 δισεκατομμύρια tokens του συνόλου, δηλαδή σε κάτι λιγότερο από 0,6%. Στην εκπαίδευση όμως της δόθηκε βάρος 3%, δηλαδή  πενταπλάσιο από το μέγεθός της, επειδή οι μηχανικοί τη θεωρούσαν πηγή υψηλότερης ποιότητας. Η αξία της συνεισφοράς  εκατομμυρίων εθελοντών μετρήθηκε με ακρίβεια χωρίς να αποδοθεί καμία χρηματική αξία στους δημιουργούς.

Τη λεπτομέρεια αυτή θυμίζουν η Jess Scully, εκτελεστική διευθύντρια του RadicalxChange, και ο Raul Castro Fernandez, επίκουρος καθηγητής Πληροφορικής στο Πανεπιστήμιο του Σικάγου, σε ένα κείμενο για την αυστραλιανή συζήτηση γύρω από την τεχνητή νοημοσύνη και την πνευματική ιδιοκτησία το οποίο αξίζει να διαβαστεί και στην Ελλάδα, καθώς σχετίζεται με τη συζήτηση που ανοίξαμε την προηγούμενη εβδομάδα για την ανοιχτή επιστήμη. Εκεί το ερώτημα ήταν ποιος ωφελείται όταν οι ερευνητές ανοίγουν τα δεδομένα τους. Εδώ αφορά όλους μας.

Τι είναι η μακριά ουρά

Οι συγγραφείς ονομάζουν «μακριά ουρά» τον τεράστιο όγκο καθημερινού, συλλογικού περιεχομένου που γράφεται στο διαδίκτυο χωρίς επαγγελματική πρόθεση: τις διορθώσεις και τα σχόλια κάτω από μια συνταγή, τις συζητήσεις στα φόρουμ, τη συγγραφή λημμάτων στη Wikipedia, την παραδοσιακή γνώση των κοινοτήτων. Στην ελληνική εκδοχή της μακριάς ουράς θα βάζαμε τις απαντήσεις σε τεχνικά φόρουμ, τα ιστολόγια που κρατούν ζωντανές τοπικές διαλέκτους, τα σχόλια στον κώδικα των έργων ανοιχτού λογισμικού, τους υπότιτλους ταινιών, τα λήμματα που γράφουν εθελοντές στην ελληνόφωνη Wikipedia.

Πρόκειται, όπως υποστηρίζουν,  για περιεχόμενο που «κανείς δεν διεκδικεί» ως προστατευόμενο. Η διατύπωση είναι προσεκτική και αξίζει να σταθούμε σε αυτήν, γιατί νομικά τα κείμενα αυτά δεν είναι ελεύθερα. Ένα σχόλιο ή ένα διήγημα προστατεύεται αυτόματα από τη στιγμή που γράφεται, χωρίς καμία διατύπωση, και η Wikipedia κυκλοφορεί με άδεια που απαιτεί αναφορά του δημιουργού και διανομή με τους ίδιους όρους. Η μακριά ουρά λοιπόν έχει δικαιούχους. Εκείνο που της λείπει είναι εκπρόσωπος καθώς κανένας εκδότης ή οργανισμός συλλογικής διαχείρισης δεν μιλά για λογαριασμό της.

Η αυστραλιανή συνταγή

Η διαφορά αυτή φάνηκε καθαρά τον Σεπτέμβριο στην Αυστραλία. Σύμφωνα με διαφάνειες διαβούλευσης του γραφείου της Γενικής Εισαγγελέως που αποκάλυψε το ABC, εξετάστηκε ένα σχήμα όπου οι εταιρείες τεχνητής νοημοσύνης θα έκλειναν συμφωνίες αδειοδότησης με έναν ελάχιστο αριθμό δικαιούχων και, μόλις συμπλήρωναν την ποσόστωση, θα μπορούσαν να εκπαιδεύουν τα μοντέλα τους στο υπόλοιπο διαθέσιμο υλικό χωρίς άλλη πληρωμή. Όποιος δεν ήθελε θα μπορούσε να εξαιρεθεί. Μια δεύτερη εκδοχή προέβλεπε πληρωμές σε κεντρικό φορέα ή σε οργανισμούς συλλογικής διαχείρισης. Η κυβέρνηση απαντά ότι ακόμη διαβουλεύεται και ότι δεν σκοπεύει να αποδυναμώσει την προστασία των δημιουργών, αφού έχει ήδη απορρίψει μια γενική εξαίρεση για την εξόρυξη κειμένων και δεδομένων. Η πίεση της βιομηχανίας πάντως είναι ορατή. Σύμφωνα με έγγραφα ενημέρωσης του αυστραλιανού Υπουργείου Οικονομικών που απέκτησε το ABC, η Anthropic έχει δηλώσει ότι επενδύσεις δεκάδων δισεκατομμυρίων σε κέντρα δεδομένων στη χώρα θα εξαρτηθούν από τη «σαφήνεια των ρυθμίσεων για την πνευματική ιδιοκτησία».

Δεν χρειάζεται να υποθέσουμε την εκ προϊμίου ύπαρξη κακής πρόθεσης για να δούμε πού οδηγεί ένα τέτοιο σχήμα. Στο τραπέζι κάθονται όσοι είναι ήδη οργανωμένοι. Για τους υπόλοιπους η μόνη επιλογή είναι να εξαιρεθούν ένας ένας, κάτι που προϋποθέτει να γνωρίζουν ότι το δικαίωμα υπάρχει, να έχουν τα τεχνικά μέσα και να διαθέτουν το χρόνο.

Εμείς έχουμε ήδη επιλέξει

Η Ευρώπη έχει απαντήσει στο ίδιο ερώτημα εδώ και χρόνια, με τρόπο που λίγοι γνωρίζουν. Η Οδηγία 2019/790 για την πνευματική ιδιοκτησία στην ψηφιακή ενιαία αγορά προβλέπει δύο εξαιρέσεις. Η πρώτη επιτρέπει στους ερευνητικούς οργανισμούς και στα ιδρύματα πολιτιστικής κληρονομιάς την εξόρυξη κειμένων και δεδομένων για επιστημονική έρευνα. Η δεύτερη, στο άρθρο 4, την επιτρέπει γενικά, και για εμπορικούς σκοπούς, σε υλικό στο οποίο η πρόσβαση είναι νόμιμη, εκτός αν ο δικαιούχος έχει επιφυλαχθεί ρητά. Για περιεχόμενο που είναι δημόσια διαθέσιμο στο διαδίκτυο, η επιφύλαξη πρέπει να γίνεται με μηχαναγνώσιμα μέσα. Η Ελλάδα ενσωμάτωσε τις διατάξεις με τον ν. 4996/2022, που πρόσθεσε τα άρθρα 21Α και 21Β στον ν. 2121/1993 για την πνευματική ιδιοκτησία.

Ο Κανονισμός για την Τεχνητή Νοημοσύνη, πρόσθεσε δύο υποχρεώσεις για τους παρόχους μοντέλων γενικής χρήσης, που ισχύουν από τον Αύγουστο του 2025. Πρέπει να εφαρμόζουν πολιτική συμμόρφωσης με το δίκαιο της πνευματικής ιδιοκτησίας, σεβόμενοι τις επιφυλάξεις, και να δημοσιεύουν επαρκώς λεπτομερή περίληψη του περιεχομένου με το οποίο εκπαιδεύτηκαν τα μοντέλα τους, σύμφωνα με υπόδειγμα που εξέδωσε η Επιτροπή. Η εποπτεία αυτών των υποχρεώσεων ανήκει αποκλειστικά στην Επιτροπή, μέσω της Υπηρεσίας για την Τεχνητή Νοημοσύνη. Η Ελλάδα θέσπισε τα εθνικά μέτρα εφαρμογής του Κανονισμού μόλις τον Ιούλιο με τον ν. 5321/2026, ο οποίος ορίζει τις αρμόδιες αρχές για τα υπόλοιπα συστήματα τεχνητής νοημοσύνης, με κεντρικό ρόλο για την Αρχή Προστασίας Δεδομένων Προσωπικού Χαρακτήρα.

Στην πράξη λοιπόν, η Ευρώπη εφαρμόζει ήδη μια παραλλαγή του σχήματος που ανησυχεί τους Αυστραλούς. Όποιος διαθέτει νομικό τμήμα και διαχειριστή ιστοτόπου μπορεί να προσθέσει μια γραμμή στο αρχείο robots.txt και να διαπραγματευτεί. Ο εθελοντής της Wikipedia, ο συντηρητής ενός μικρού φόρουμ ή η συντάκτρια ενός ιστολογίου για τη ντοπιολαλιά του νησιού της ούτε καν το γνωρίζουν ούτε και έχουν λόγο να ασχοληθούν ενώ το περιεχόμενό τους παραμένει διαθέσιμο. Πολλοί από αυτούς, άλλωστε, γράφουν για να διαβαστούν ελεύθερα και δεν θα ήθελαν να περιορίσουν την πρόσβαση. Για τη μακριά ουρά, λοιπόν, το κλείσιμο δεν είναι η λύση. Λείπει όμως κάποιος που να μπορεί να μιλήσει για το θέμα.

Ζήτημα και ποιότητας

Θα μπορούσε κανείς να πει ότι πρόκειται μόνο για ένα ζήτημα δικαιοσύνης χωρίς πρακτικές συνέπειες. Ωστόσο, οι συγγραφείς θυμίζουν μια μελέτη του Nature του 2024 που δείχνει το αντίθετο. Όταν τα μοντέλα εκπαιδεύονται σε κείμενο που παρήγαγαν άλλα μοντέλα, τα δεδομένα προέλευσης μακριάς ουράς της αρχικής κατανομής εξαφανίζονται και κάπως έτσι τα σπάνια, τα ιδιόμορφα και τα τοπικά περιεχόμενα χάνονται πρώτα. Μια άλλη πρόσφατη εργασία περιγράφει έναν «φόρο ευθυγράμμισης» όταν ένα μοντέλο προσαρμόζεται σε κάποια γλώσσα με λίγους πόρους, αφού η βελτίωση εκεί πληρώνεται με απώλειες σε άλλες ικανότητες. Για μια γλώσσα σαν την ελληνική, που σε μεγάλο βαθμό ζει στη μακριά ουρά του διαδικτύου, η ανησυχία είναι βάσιμη. Όσο σπανίζει το ζωντανό ανθρώπινο κείμενο, τόσο πολυτιμότερο γίνεται, και τόσο πιο παράλογο είναι να μην έχει λόγο κανείς από όσους το δημιουργούν.

Μια ρεαλιστική διέξοδος

Οι Scully και Castro Fernandez προτείνουν ένα ταμείο κοινών δεδομένων, του οποίου τη διάθεση θα αποφασίζουν συμμετοχικά εκπρόσωποι της μακριάς ουράς. Η ιδέα είναι ελκυστική, οι ίδιοι όμως παραδέχονται ότι ακόμη τη σχεδιάζουν, και τα δύσκολα ερωτήματα μένουν ανοιχτά: ποιος εκπροσωπεί ένα απροσδιόριστο πλήθος, πώς αποφεύγεται να το καταλάβουν οι πιο οργανωμένοι, ποιος βάζει τα χρήματα. Όσοι έχουμε ασχοληθεί με τις ψηφιακές διαβουλεύσεις γνωρίζουμε καλά ότι η δημόσια συμμετοχή δεν προκύπτει αυτόματα επειδή στήθηκε μια πλατφόρμα.

Υπάρχει ωστόσο ένας δρόμος πιο ρεαλιστικός, που δεν χρειάζεται νέους νόμους ούτε νέους οργανισμούς. Ξεκινά από τα εργαλεία που ήδη έχουμε. Οι περιλήψεις δεδομένων εκπαίδευσης που επιβάλλει ο Κανονισμός μπορούν να γίνουν εργαλείο ορατότητας. Με αυτές, πανεπιστήμια, βιβλιοθήκες και οργανώσεις της κοινωνίας των πολιτών μπορούν να καταγράφουν συστηματικά πόσο ελληνόγλωσσο περιεχόμενο, και από ποιες πηγές, χρησιμοποιείται στα μοντέλα, ώστε η συζήτηση να γίνεται με στοιχεία.

Ο δεύτερος κρίκος είναι η εκπροσώπηση. Η μακριά ουρά δεν έχει μεγαλοεκδότη, έχει όμως θεσμούς που τη φροντίζουν ήδη: τις κοινότητες της Wikimedia, τις δημόσιες βιβλιοθήκες, τα πανεπιστήμια, τις οργανώσεις ανοιχτού λογισμικού. Αν στη συζήτηση για την αδειοδότηση, που αργά ή γρήγορα θα έρθει και στην Ελλάδα, παρίστανται μόνο οι εκδότες και οι οργανισμοί συλλογικής διαχείρισης, η αυστραλιανή ασυμμετρία θα επαναληφθεί κι εδώ. Αν όμως έχουν θέση και οι θεσμοί των κοινών, ως θεματοφύλακες και όχι ως ιδιοκτήτες, η εικόνα αλλάζει. Στην ΕΕΛΛΑΚ το δοκιμάζουμε ήδη στην πράξη με το GlossAPI, το αποθετήριο τεκμηριωμένων, ανοιχτών ελληνικών γλωσσικών δεδομένων. Όπου μπορούμε, διαθέτουμε τα δεδομένα με ανοιχτές άδειες και ζητάμε από όσους τα επαναχρησιμοποιούν να μας πουν ποιοι είναι και πώς θα τα αξιοποιήσουν. Ξέρουμε βέβαια ότι το ζήτημα δεν λύνεται τόσο απλά, αφού ένα τέτοιο αίτημα δεν δεσμεύει όσους συλλέγουν τα δεδομένα μαζικά. Είναι όμως ένας πρώτος τρόπος να υπάρχει θεματοφύλακας που μπορεί να μετρήσει, να ρωτήσει και, όταν έρθει η ώρα, να διαπραγματευτεί.

Ο τρίτος κρίκος είναι τα χρήματα. Όπου κλείνονται συλλογικές συμφωνίες, ένα σταθερό ποσοστό θα μπορούσε να κατευθύνεται στις υποδομές που κρατούν τα κοινά ζωντανά, στα αποθετήρια, στα γλωσσικά δεδομένα, στη συντήρηση του ανοιχτού λογισμικού. Δεν θα ήταν αποζημίωση για κάθε σχόλιo, που ούτε εφικτή είναι ούτε την επιθυμούν οι περισσότεροι από όσους γράφουν ελεύθερα. Θα ήταν όμως μια επένδυση στο έδαφος από το οποίο τρέφονται όλα τα μοντέλα.

Οι συγγραφείς κλείνουν γράφοντας ότι η Αυστραλία έχει την ευκαιρία να γίνει η πρώτη χώρα που θα ονομάσει και θα χρηματοδοτήσει το κομμάτι του διαδικτύου που χτίσαμε όλοι μαζί. Η Ευρώπη, και η Ελλάδα μαζί της, έχει ήδη τα περισσότερα εργαλεία για κάτι αντίστοιχο. Της λείπει η απόφαση για να δει και να αντιμετωπίσει τη μακριά ουρά ως κοινό αγαθό που χρειάζεται φροντίδα.

Leave a Comment