Από την υποεκπροσώπηση στη γλωσσική κυριαρχία
Η ανάπτυξη του AMALIA δείχνει με πρακτικό τρόπο τι σημαίνει η δημιουργία ενός μεγάλου γλωσσικού μοντέλου ως δημόσιας ερευνητικής υποδομής και όχι ως κλειστού προϊόντος. Το πρόβλημα που επιχειρεί να λύσει είναι γνωστό σε όλες τις ευρωπαϊκές γλώσσες με μικρότερη παρουσία στα μεγάλα σύνολα εκπαίδευσης: τα κυρίαρχα μοντέλα μαθαίνουν κυρίως από αγγλικά δεδομένα, ενώ ακόμη και όταν υποστηρίζουν άλλες γλώσσες συχνά μπερδεύουν γλωσσικές ποικιλίες, πολιτισμικές αναφορές και τοπικές χρήσεις. Στην περίπτωση των πορτογαλικών, η υπεροχή των βραζιλιάνικων πορτογαλικών στο διαδίκτυο επηρεάζει την ικανότητα των μοντέλων να παράγουν σταθερά ευρωπαϊκά πορτογαλικά. Το AMALIA σχεδιάστηκε ακριβώς για να αντιμετωπίσει αυτή την ανισορροπία.
Η βασική του επιλογή δεν ήταν να δημιουργηθεί απλώς ένα ακόμη μοντέλο γενικής χρήσης. Ήταν να βελτιωθεί στοχευμένα ένα ευρωπαϊκό γλωσσικό υπόβαθρο, το EuroLLM-9B, με έμφαση στην πορτογαλική γλώσσα όπως χρησιμοποιείται στην Πορτογαλία. Αυτό σημαίνει ότι το AMALIA δεν στηρίχθηκε μόνο σε μεγαλύτερο όγκο δεδομένων, αλλά σε μια σειρά αποφάσεων για την προέλευση, το φιλτράρισμα, την ποιότητα, την αξιολόγηση και την ανοιχτή διάθεση των πόρων.
Η πρώτη ύλη: από το Arquivo.pt στα καθαρά δεδομένα εκπαίδευσης
Το τεχνικό θεμέλιο του AMALIA ήταν η συστηματική αξιοποίηση του Arquivo.pt, του πορτογαλικού αρχείου του ιστού. Η ομάδα συνέλεξε μεγάλες συλλογές WARC αρχείων, συνολικού ακατέργαστου μεγέθους 195 TB, με στόχο να αντλήσει κείμενα που αποτυπώνουν πραγματική χρήση της γλώσσας στον δημόσιο πορτογαλικό ιστό. Αυτό είναι κρίσιμο, γιατί ένα γλωσσικό μοντέλο δεν μαθαίνει μόνο γραμματική. Μαθαίνει συμφραζόμενα, διοικητικές διατυπώσεις, δημόσιο λόγο, καθημερινές εκφράσεις, λεξιλογικές αποχρώσεις και πολιτισμικές συνδέσεις.
Το δύσκολο μέρος δεν ήταν η συλλογή, αλλά η μετατροπή του υλικού σε αξιόπιστο σώμα εκπαίδευσης. Η ομάδα κατασκεύασε αγωγό επεξεργασίας εμπνευσμένο από τις πρακτικές του FineWeb2, χρησιμοποιώντας τη βιβλιοθήκη DataTrove. Πρώτα εφαρμόστηκε φιλτράρισμα URL, με απομάκρυνση τομέων “.br”, ώστε να μειωθεί η παρουσία βραζιλιάνικου περιεχομένου. Έπειτα χρησιμοποιήθηκαν κατάλογοι αποκλεισμού για ακατάλληλο περιεχόμενο και εξαγωγή καθαρού κειμένου από HTML με το Trafilatura. Ακολούθησε καθαρισμός σύντομων ή διπλότυπων γραμμών, αναγνώριση γλώσσας, ποιοτικά φίλτρα, φίλτρα επανάληψης και αφαίρεση προσωπικών δεδομένων όπως διευθύνσεις IP, emails και αριθμοί τηλεφώνου.
Η αποδιπλοποίηση έγινε με MinHash, ώστε να περιοριστεί η υπερεκπροσώπηση επαναλαμβανόμενων σελίδων και τυποποιημένων κειμένων. Στο τέλος, τα δεδομένα ταξινομήθηκαν με το μοντέλο EuroFilter σε ποιοτικές κατηγορίες. Για την εκπαίδευση χρησιμοποιήθηκαν τα υψηλής και μεσαίας ποιότητας τμήματα, συνολικού μεγέθους περίπου 5,8 δισεκατομμυρίων tokens. Αυτή η διαδικασία δείχνει ότι η ποιότητα των δεδομένων δεν είναι δευτερεύον βήμα. Είναι η βασική πράξη σχεδιασμού ενός γλωσσικού μοντέλου.
Επέκταση του EuroLLM με μεγαλύτερο συμφραζόμενο
Το AMALIA βασίστηκε στην τελική φάση προεκπαίδευσης του EuroLLM-9B. Η ομάδα δεν ξεκίνησε από μηδενικό μοντέλο, αλλά πήρε ένα ευρωπαϊκό πολυγλωσσικό υπόβαθρο και το συνέχισε με νέα μίγματα δεδομένων. Το μίγμα περιλάμβανε τέσσερις βασικές πηγές: το αρχικό μίγμα του EuroLLM, περίπου 40 δισεκατομμύρια tokens από πολλές ευρωπαϊκές γλώσσες, 60 δισεκατομμύρια πρόσθετα tokens με καλύτερη κάλυψη κώδικα, 1,4 δισεκατομμύρια συνθετικά tokens για μακρά συμφραζόμενα και τα 5,8 δισεκατομμύρια tokens από το Arquivo.pt.
Η σημαντική αρχιτεκτονική αλλαγή ήταν η αύξηση του μέγιστου μήκους συμφραζομένων από 4K σε 32K tokens. Για να γίνει αυτό, εφαρμόστηκε κλιμάκωση RoPE, με αύξηση της σχετικής παραμέτρου από 10.000 σε 1.000.000. Με απλά λόγια, το AMALIA εκπαιδεύτηκε ώστε να μπορεί να διαχειρίζεται πολύ μεγαλύτερα κείμενα χωρίς να χάνει τη συνοχή του. Αυτό είναι ιδιαίτερα χρήσιμο για διοικητικά έγγραφα, νομικά κείμενα, εκπαιδευτικό υλικό, τεχνικές αναφορές και πολυγλωσσική τεκμηρίωση.
Η προεκπαίδευση διήρκεσε 80 ώρες σε 256 NVIDIA H100 GPUs. Η κλίμακα αυτή δείχνει ότι ένα σοβαρό εθνικό ή γλωσσικό μοντέλο δεν είναι απλή υπόθεση, αλλά και ότι δεν απαιτεί κατ’ ανάγκην τα αδιαφανή μεγέθη των κλειστών υπερμοντέλων. Με σωστό σχεδιασμό, στοχευμένη συνέχεια εκπαίδευσης και υψηλής ποιότητας δεδομένα, ένα μοντέλο 9B παραμέτρων μπορεί να αποκτήσει ουσιαστικές ικανότητες σε μια συγκεκριμένη γλωσσική κοινότητα.
Μετά την προεκπαίδευση: οδηγίες, διάλογος, μαθηματικά και ασφάλεια
Το δεύτερο στάδιο ήταν η εποπτευόμενη προσαρμογή, δηλαδή η εκπαίδευση του μοντέλου να ακολουθεί οδηγίες, να απαντά σε διάλογο και να λύνει προβλήματα. Το μίγμα εκπαίδευσης οργανώθηκε σε τέσσερις κατηγορίες: ακολουθία οδηγιών, συνομιλιακή συλλογιστική, μαθηματική επίλυση προβλημάτων και ασφάλεια.
Εδώ η ομάδα συνδύασε χειροποίητα δεδομένα, συνθετικά δεδομένα και δημόσια διαθέσιμα σύνολα από το Hugging Face, με ανοιχτές άδειες. Για να αυξηθεί η ποικιλία των παραδειγμάτων χρησιμοποιήθηκε η μέθοδος PersonaHub, δηλαδή παραγωγή παραδειγμάτων από πολλαπλές υποθετικές περσόνες. Δημιουργήθηκαν δεδομένα στα ευρωπαϊκά πορτογαλικά και στα αγγλικά, ενώ για τη μετάφραση χρησιμοποιήθηκαν ένα εξειδικευμένο μεταφραστικό μοντέλο ευρωπαϊκών πορτογαλικών και το Gemma 3-27B, με επακόλουθη παραγωγή ερωτήσεων και απαντήσεων. Η χρήση διαφορετικών μοντέλων παραγωγής μείωσε τον κίνδυνο να αποκτήσει το AMALIA μια στενή ή μονοδιάστατη συμπεριφορά.
Ιδιαίτερο ενδιαφέρον έχει το μικρό αλλά ποιοτικό σύνολο γλωσσικών οδηγιών, 200 παραδειγμάτων, επιμελημένο από ειδικό στη γλωσσολογία των πορτογαλικών. Περιλάμβανε φωνητική, ορθογραφία, ιδιωματισμούς, παιχνίδια λέξεων και γραμματική ταξινόμηση. Αυτό είναι μάθημα και για άλλες γλώσσες, όπως τα ελληνικά: η γλωσσική επάρκεια δεν προκύπτει μόνο από πολλά δεδομένα, αλλά από ειδικά σχεδιασμένα παραδείγματα για τα δύσκολα σημεία της γλώσσας.
Η εποπτευόμενη προσαρμογή έγινε σε 14.000 βήματα, περίπου 4,25 εποχές, με AdamW, bfloat16 και επιλογή τελικού checkpoint με βάση το σύνολο επικύρωσης. Η εκπαίδευση διήρκεσε 76 ώρες σε 64 H100 GPUs.
Προτιμησιακή εκπαίδευση και ευθυγράμμιση
Το τρίτο στάδιο ήταν η προτιμησιακή εκπαίδευση με Direct Preference Optimization. Η αρχική προσέγγιση χρησιμοποίησε 200.000 prompts από το SFT σύνολο. Για κάθε prompt παράχθηκαν 32 υποψήφιες απαντήσεις από το ίδιο το AMALIA-SFT, βαθμολογήθηκαν με το reward model ArmoRM και επιλέχθηκαν οι καλύτερες και χειρότερες ως ζεύγη προτίμησης.
Όμως η ομάδα εντόπισε ένα συνηθισμένο πρόβλημα: η γενική προτιμησιακή εκπαίδευση μπορεί να βελτιώνει συνολικά τη συμπεριφορά, αλλά να χειροτερεύει μαθηματική συλλογιστική ή αυστηρή τήρηση οδηγιών. Για τον λόγο αυτό εμπλουτίστηκε το μίγμα με εξειδικευμένα ζεύγη. Στα μαθηματικά, καλύτερες απαντήσεις παράχθηκαν με ισχυρότερο Qwen 3-32B και χειρότερες με Qwen 3-0.6B. Σε πορτογαλικά δεδομένα προστέθηκαν επιπλέον παραδείγματα Persona-Nemotron για γενική χρήση, μαθηματικά και ακολουθία οδηγιών. Για την ασφάλεια ενσωματώθηκαν σύνολα που στοχεύουν σε επικίνδυνα prompts και πολιτισμικά προσαρμοσμένη ασφαλή συμπεριφορά. Το τελικό μίγμα περιλάμβανε 478.000 ζεύγη προτίμησης και εκπαιδεύτηκε για μία εποχή σε 64 H100 GPUs.
Αξιολόγηση με κριτήρια
Το πιο σημαντικό στοιχείο του AMALIA δεν είναι μόνο το μοντέλο, αλλά και η σουίτα αξιολόγησης. Η ομάδα δεν αρκέστηκε σε μηχανικά μεταφρασμένα benchmarks. Δημιούργησε νέα σύνολα για τα ευρωπαϊκά πορτογαλικά: συμπληρώσεις προτάσεων που ξεχωρίζουν pt-PT από pt-BR, ερωτήσεις από εθνικές εξετάσεις, το ALBA για γλωσσική επάρκεια και το P3B3 για έλεγχο μεροληψίας προς πορτογαλικές ποικιλίες.
Τα αποτελέσματα δείχνουν ότι το AMALIA είναι ανταγωνιστικό με άλλα ανοιχτά μοντέλα αντίστοιχου μεγέθους και υπερέχει στα ειδικά pt-PT benchmarks. Η έκδοση DPO πέτυχε ιδιαίτερα υψηλές επιδόσεις σε εξετάσεις, γλωσσική αξιολόγηση και παραγωγή ευρωπαϊκών πορτογαλικών. Στα τεστ ασφάλειας εμφάνισε χαμηλά ποσοστά επιτυχίας επιθέσεων, ένδειξη ότι η ευθυγράμμιση βελτίωσε και την ανθεκτικότητα απέναντι σε κακόβουλες οδηγίες.
Τι μας διδάσκει το AMALIA
Το AMALIA είναι σημαντικό γιατί δείχνει έναν εφικτό δρόμο για τις γλώσσες της Ευρώπης. Πρώτον, τα γλωσσικά μοντέλα δεν πρέπει να κρίνονται μόνο με αγγλοκεντρικά μέτρα. Δεύτερον, τα εθνικά αρχεία ιστού, οι δημόσιες βιβλιοθήκες, τα εκπαιδευτικά σώματα και τα διοικητικά κείμενα μπορούν να γίνουν στρατηγικές υποδομές ΤΝ, αρκεί να καθαριστούν, να τεκμηριωθούν και να διατεθούν με ανοιχτούς όρους. Τρίτον, η πλήρης ανοιχτότητα χρειάζεται μοντέλα, δεδομένα, κώδικα, benchmarks, άδειες και διαδικασίες αξιολόγησης. Δεν αρκεί η δημοσίευση βαρών.
Για την Ελλάδα, το δίδαγμα είναι άμεσο. Ένα πλήρως ανοιχτό ελληνικό γλωσσικό μοντέλο δεν πρέπει να είναι αντιγραφή ενός διεθνούς μοντέλου. Πρέπει να βασιστεί σε ελληνικά δημόσια δεδομένα υψηλής ποιότητας, σε εργαλεία όπως το GlossAPI, σε ανοιχτά πρότυπα τεκμηρίωσης, σε γλωσσολογική επιμέλεια και σε γηγενή benchmarks που μετρούν την πραγματική χρήση της ελληνικής γλώσσας. Το AMALIA δείχνει ότι η γλωσσική κυριαρχία στην ΤΝ δεν είναι σύνθημα. Είναι αγωγός δεδομένων, υπολογιστική υποδομή, ανοιχτή άδεια, αξιολόγηση και δημόσια λογοδοσία.

