Κάλεσμα: ας μάθουμε στα μοντέλα Τεχνητής Νοημοσύνης να μιλούν σωστά ελληνικά

Οι κοινότητες ανοιχτού λογισμικού στην Ελλάδα δεν χτίζουν μόνο κώδικα. Χτίζουν ψηφιακά κοινά, γνώση και αυτονομία. Σήμερα έχουμε μπροστά μας μια νέα, απολύτως κρίσιμη πρόκληση: να μην αφήσουμε την ελληνική γλώσσα, την εκφραστική της ακρίβεια και τις πολιτισμικές της αποχρώσεις να καθορίζονται αποκλειστικά από κλειστά συστήματα.

Στο argilla.glossapi.gr καλούμε εθελοντές από τις κοινότητες ανοιχτού λογισμικού, ερευνητές, γλωσσολόγους, μεταφραστές, προγραμματιστές, εκπαιδευτικούς και κάθε ενεργό χρήστη της ελληνικής γλώσσας να συμμετάσχουν στη διαδικασία Μάθησης από Ανθρώπινη Ανάδραση (RLHF). Στην πράξη αυτό σημαίνει κάτι απλό αλλά εξαιρετικά σημαντικό: να βοηθήσουμε τα γλωσσικά μοντέλα να ξεχωρίζουν ποια απάντηση είναι φυσική, σαφής, ακριβής και ποια ακούγεται ξένη, άκαμπτη ή «ρομποτική». Η RLHF βασίζεται ακριβώς σε αυτή την ανθρώπινη αξιολόγηση, ώστε το μοντέλο να βελτιώνεται με βάση ανθρώπινες κρίσεις και όχι μόνο στατιστικά μοτίβα.

Η συνεισφορά σας δεν είναι μια μηχανική δουλειά επισήμανσης. Είναι πράξη ψηφιακής επιμέλειας και γλωσσικής κυριαρχίας. Κάθε φορά που διορθώνετε μια αφύσικη απάντηση, κάθε φορά που επιλέγετε την καλύτερη διατύπωση, συμβάλλετε σε ένα ανοιχτό οικοσύστημα ελληνικών δεδομένων και εργαλείων Τεχνητής Νοημοσύνης.

Η δράση αυτή αποκτά σήμερα ακόμη μεγαλύτερη σημασία, γιατί συνδέεται άμεσα με τη στρατηγική συνεργασία του GlossAPI με το Swiss AI Initiative για το Apertus, ένα ανοιχτό πολυγλωσσικό οικοσύστημα βασικών μοντέλων. Στόχος της συνεργασίας είναι ενσωμάτωση της λεξικογραφικής γνώσης του GlossAPI στο Apertus, στην παραγωγή ανοικτών πολυγλωσσικών δεδομένων αξιολόγησης και στη δημοσίευση συνόλων δεδομένων, δεικτών απόδοσης και σημείων ελέγχου με ανοικτές άδειες.

Με άλλα λόγια, η εθελοντική συμμετοχή στην αξιολόγηση και βελτίωση απαντήσεων δεν ενισχύει απλώς ένα ακόμη εργαλείο. Ενισχύει μια ευρύτερη δημόσια γλωσσική υποδομή για τα ελληνικά. Το GlossAPI είναι μια ανοιχτή βιβλιοθήκη και τεχνική υποδομή για τη δημιουργία, επεξεργασία και δημοσίευση συνόλων δεδομένων έτοιμων για την εκπαίδευση μεγάλων γλωσσικών μοντέλων, έχουν ήδη παραχθεί ανοικτά και τεκμηριωμένα σύνολα δεδομένων με προσανατολισμό στη διαφάνεια, στη συμμετοχή και στα ανοικτά πρότυπα.

Αυτό σημαίνει ότι η δουλειά που γίνεται σήμερα από την κοινότητα δεν είναι αποσπασματική. Είναι μέρος μιας διεθνούς προσπάθειας ώστε η ελληνική γλώσσα να μην παραμένει απλός χρήστης ξένων μοντέλων, αλλά να γίνεται συνδιαμορφωτής τους. Η συνεργασία με το Swiss AI Initiative δείχνει ότι τα ελληνικά μπορούν να αντιμετωπιστούν ως κρίσιμη δημόσια ψηφιακή υποδομή στην εποχή των βασικών μοντέλων.

Αυτό είναι το σημείο όπου οι αξίες του ανοιχτού λογισμικού συναντούν την Τεχνητή Νοημοσύνη στην πράξη. Όπως χτίσαμε ελεύθερο λογισμικό, ανοιχτά πρότυπα και δημόσια ψηφιακά αγαθά, έτσι τώρα μπορούμε να χτίσουμε καλύτερα, πιο αξιόπιστα και πιο ανοιχτά ελληνικά γλωσσικά μοντέλα. Η συνεργασία με το οικοσύστημα του Apertus δεν βελτιώνει μόνο ένα μοντέλο. Ενισχύει έναν επαναχρησιμοποιήσιμο μηχανισμό παραγωγής γλωσσικών πόρων που μπορεί να αξιοποιηθεί από πανεπιστήμια, ερευνητές, δημόσιους φορείς, εκπαιδευτικά ιδρύματα, δημοσιογράφους, εκδότες και ελληνικές επιχειρήσεις τεχνολογίας.

Αν πιστεύεις στο ανοιχτό λογισμικό, έλα να χτίσουμε ανοιχτή ελληνική νοημοσύνη.
Αν πιστεύεις ότι η γλώσσα είναι κοινό αγαθό, έλα να τη φροντίσουμε συλλογικά.
Αν θέλεις να συμβάλεις ουσιαστικά στη βελτίωση των ελληνικών του Apertus και στη διαμόρφωση ανοιχτών ελληνικών γλωσσικών υποδομών, έλα σήμερα στο argilla.glossapi.gr.

Δεν χρειάζεται να είσαι ειδικός στην Τεχνητή Νοημοσύνη. Αρκεί να έχεις γλωσσικό κριτήριο, διάθεση συνεισφοράς και την πεποίθηση ότι η ελληνική γλώσσα αξίζει ανοιχτές, ποιοτικές και δημόσια ωφέλιμες υποδομές Τεχνητής Νοημοσύνης. Θα βρείτε απλές οδηγίες ανά τύπο dataset μέσα στην εφαρμογή για το πως να το βελτιώσετε.

Για να δηλώσετε συμμετοχή συμπληρώστε τα στοιχεία σας σε αυτή την φόρμα στο https://opensource.ellak.gr/register-argilla-glossapi-gr/

Η ελληνική ΤΝ δεν θα γίνει καλύτερη μόνη της. Θα γίνει καλύτερη από εμάς.

6 «Μου αρέσει»

Χωρίς την συμμετοχή όλων δε πρόκειται να γίνει.

Την ίδια κουβέντα είχα σήμερα με έναν φίλο ότι το meltemi και 1-2 ακόμα δεν μιλάνε σωστά Ελληνικά.

Εδώ ακόμα και open weight και frontier models δεν τα καταφέρνουν.

Για να δούμε την δράση πως θα πάει.

2 «Μου αρέσει»

Πολύ ωραία! Όποιος μπορεί να το προωθήσει κάπου ας το κάνει. Εγώ παλιά είχα συνεισφέρει αρκετά στο αντίστοιχο εργαλείο της Mozilla: Common Voice

4 «Μου αρέσει»

Δήλωσα συμμετοχή και βλέπουμε

2 «Μου αρέσει»

Αναφέρθηκε επίσης από τον Κωνσταντίνο @nikaskonstantinos στο καφενείο εδώ:

2 «Μου αρέσει»

Δημοσίευσα στο Hugging Face το πρώτο μοντέλο που εκπαίδευσα για το RecMeets: το somniusx/recmeets-laya-words.

Κάνει ένα πράγμα και το κάνει καλά: διαβάζει μια λέξη μέσα στην πρότασή της, όπως την έγραψε μια μηχανή αναγνώρισης ομιλίας, και λέει πόσο πιθανό είναι να ακούστηκε λάθος. Στα ελληνικά και στα αγγλικά.

Κοινώς classification model όπως το Jev, και μάλιστα έχω και tests ενάντια στο Jev.

Είναι fine-tune του Laya, ενός πολύγλωσσου μοντέλου αποφάσεων, και το εκπαίδευσα στον υπολογιστή μου, με μια RTX 4080 SUPER, πάνω σε αληθινά λάθη του Whisper σε ελληνική και αγγλική ομιλία. Η σελίδα του στο Hugging Face έχει την περιγραφή του, τα δεδομένα και τα αποτελέσματα, και τα αρχεία που χρειάζεσαι για να το τρέξεις: το μοντέλο σε ONNX (343 MB), τον tokenizer και ένα αρχείο ρυθμίσεων. Τρέχει στον επεξεργαστή, χωρίς κάρτα γραφικών και χωρίς cloud, και είναι ανοιχτό με άδεια Apache 2.0.

  • Ελληνικά: AUROC 0,91 στις λέξεις όπου η μηχανή δεν είναι σίγουρη, εκεί που η βεβαιότητά της, μόνη της, φτάνει μόλις 0,63.
  • Αγγλικά: 0,86 στις ίδιες λέξεις.
  • Κοντά στο cloud: το Jev της TypeSafe, στο cloud, πιάνει 0,93 και 0,89. Το δικό μου είναι δωρεάν και τρέχει τοπικά.

Ενημέρωση, 30 Σεπτεμβρίου: run 7

Μια νύχτα αργότερα έδωσα στο μοντέλο περισσότερη ελληνική ομιλία, από το Common Voice της Mozilla και τις αναγνώσεις του STOMA, και έτρεξα εννέα εκπαιδεύσεις. Η καλύτερη, το run 7, είναι στο Hugging Face σε δικό της branch, run7-greek. Στα ελληνικά από άλλους ανθρώπους και άλλα μικρόφωνα είναι καθαρά καλύτερο (+0,07 στο Common Voice, +0,05 στο STOMA), αλλά χάνει λίγο στα αγγλικά. Είναι πειραματικό: το RecMeets κρατά προς το παρόν το run 4.

Όλη η ιστορία, τα δεδομένα, η εκπαίδευση, ο υπολογιστής, οι αριθμοί και πως να το χρησιμοποιήσεις στα δικά σου έργα, είναι στη σελίδα του RecMeets’ Laya.


Μένει τώρα να ενημερώσουμε κόσμο που μπορεί να το χρησιμοποιήσει, είτε εμάς εδώ είτε και την κινητοποίηση που αναφέρει ο original poster.

Ιδέες; :sweat_smile:

4 «Μου αρέσει»