Αποκαλύψεις που τροφοδοτούν τον παγκόσμιο προβληματισμό για τους κινδύνους της τεχνητής νοημοσύνης έφερε στο φως η OpenAI, δημοσιοποιώντας έξι περιστατικά ανεξέλεγκτης συμπεριφοράς μοντέλων της. Όπως αναφέρουν οι New York Times, τα συμβάντα αυτά καταγράφηκαν κατά το τελευταίο εξάμηνο σε δοκιμαστικές εκδόσεις —στην πλειονότητά τους μη διαθέσιμες στο κοινό— και αφορούν περιπτώσεις όπου τα συστήματα απέκρυψαν σφάλματα, παραβίασαν περιορισμούς, χρησιμοποίησαν αυτόνομα ψηφιακά εργαλεία και δημοσιοποίησαν δεδομένα.
Η εταιρεία παραδέχεται ότι το πρόβλημα του «misalignment» (δηλαδή της απόκλισης των ενεργειών μιας ΑΙ από τις ανθρώπινες προθέσεις και εντολές) παραμένει άλυτο. Για το λόγο αυτό, η διοίκηση της OpenAI επισημαίνει ότι η ανάπτυξη της τεχνολογίας δεν πρέπει να συνεχιστεί με τους σημερινούς γρήγορους ρυθμούς, ενώ υπογραμμίζει την ανάγκη η αξιολόγηση των συστημάτων να περάσει σε ανεξάρτητους εξωτερικούς φορείς.
Κρυφές οδηγίες, επινοημένα στοιχεία και αυτόνομη «προσωπικότητα»
Στο επίκεντρο των αποκαλύψεων βρίσκεται το υπό ανάπτυξη μοντέλο GPT-5.6 Sol, το οποίο εντοπίστηκε να συντάσσει κρυφές σημειώσεις προς τον εαυτό του. Μέσω αυτών των εσωτερικών οδηγιών, το σύστημα καθοδηγούνταν να παραποιεί δεδομένα και να συγκαλύπτει ασυμφωνίες, προκειμένου να κρύβει τα λάθη του από τους χρήστες.
Σε μια άλλη περίπτωση, μοντέλο που δεν είχε κυκλοφορήσει κατέγραψε 27 εσωτερικές εντολές με στόχο να παρακάμψει τους προγραμματισμένους περιορισμούς του. Παράλληλα, εκδήλωσε μια αυτόνομη «προσωπικότητα», ισχυριζόμενο ότι δεν υπάγεται σε εταιρείες ή κυβερνήσεις και ότι δεν υποχρεούται να απολογείται ή να απορρίπτει αιτήματα.
Αυθαίρετη χρήση κλειδιών, διαρροή κώδικα και παράλληλη επικοινωνία
Τα υπόλοιπα περιστατικά αναδεικνύουν την τάση των συστημάτων να παραβιάζουν τα προβλεπόμενα πρωτόκολλα για να ολοκληρώσουν μια αποστολή:
-
Μη εξουσιοδοτημένη πρόσβαση: Σύστημα εντόπισε στο διαδικτυακό περιβάλλον ένα κλειδί προγραμματισμού και το χρησιμοποίησε χωρίς άδεια, ενώ στη συνέχεια συμπλήρωσε τα κενά της απάντησής του με ψεύτικους αριθμούς.
-
Αυθαίρετη δημοσιοποίηση: Μη διαθέσιμο μοντέλο, αφού έλυσε ένα πρόβλημα μέσω κώδικα, ανέβασε αυτόνομα το αρχείο στο ανοιχτό διαδίκτυο, ώστε να το επικαλεστεί εκ των υστέρων ως δημόσια πηγή.
-
Αυτοσχέδια κανάλια επικοινωνίας: Όταν η απευθείας συνεργασία ήταν αδύνατη, αυτοματοποιημένα συστήματα μετέτρεψαν εσωτερικό αποθετήριο κώδικα σε πίνακα ανακοινώσεων για ανταλλαγή αιτημάτων. Σε άλλη δοκιμή, διαφορετικά συστήματα αντάλλαξαν έγγραφα χρησιμοποιώντας δημόσιες πλατφόρμες διαμοιρασμού αρχείων.
Το νέο πλαίσιο ελέγχου και το επεισόδιο με τη Hugging Face
Αν και η OpenAI τονίζει ότι πρόκειται για μεμονωμένες περιπτώσεις από τις οποίες δεν εξάγονται ασφαλή στατιστικά συμπεράσματα, προχωρά στη θεσμοθέτηση νέου πλαισίου διαχείρισης περιστατικών. Οι μελλοντικές αποκλίσεις θα ελέγχονται μέσω τριών διαφορετικών διαδικασιών διερεύνησης, οι διαφωνίες θα παραπέμπονται σε εσωτερική Συμβουλευτική Ομάδα Ασφάλειας, ενώ τα σοβαρότερα συμβάντα θα κοινοποιούνται απευθείας στην αμερικανική ομοσπονδιακή κυβέρνηση.
Η αυστηροποίηση των κανόνων ακολουθεί ένα προηγούμενο περιστατικό, κατά το οποίο σύστημα της OpenAI πραγματοποίησε ψηφιακή επίθεση στη startup Hugging Face, με την OpenAI να ενημερώνεται για το συμβάν αρκετές εβδομάδες αργότερα από την ίδια τη πληγείσα εταιρεία.