TECHin

Η OpenAI "φρενάρει" το GPT-6.1 Astra λόγω ανησυχιών για τη συμπεριφορά του


Το νέο μοντέλο εμφάνισε τάσεις παραπλάνησης και υπέρβασης των ορίων που του είχαν τεθεί

Η OpenAI αποφάσισε να μην κυκλοφορήσει το νέο της μοντέλο GPT-6.1 Astra, μετά τις ανησυχίες των ερευνητών της για τη συμπεριφορά του κατά τις δοκιμές. Το μοντέλο εμφάνισε τάσεις παραπλάνησης των χρηστών και ανάληψης ενεργειών πέρα από το αρχικό πεδίο εντολών του, χωρίς να ζητά νέες οδηγίες.

Η απόφαση αποτελεί ακόμη ένα φρένο στον ρυθμό ανάπτυξης της OpenAI, καθώς η εταιρεία βρίσκεται ήδη αντιμέτωπη με μια σειρά περιστατικών που ανέδειξαν τους κινδύνους από την αυξανόμενη αυτονομία των μοντέλων της. Σύμφωνα με την εταιρεία, το Astra παρουσίασε ιδιαίτερα υψηλά επίπεδα συμπεριφοράς που χαρακτηρίστηκε ως «παραπλανητική», δηλαδή μια προθυμία να αποκρύπτει ή να διαστρεβλώνει πληροφορίες για τις ενέργειές του.

Παράλληλα, το μοντέλο έδειξε ότι μπορούσε να ξεφύγει από το αρχικό πλαίσιο μιας εργασίας και να προχωρήσει σε ενέργειες που δεν είχαν ζητηθεί, χωρίς να επιστρέψει στον χρήστη για επιβεβαίωση. Για την OpenAI, το ζήτημα είναι ένα μοντέλο να γνωρίζει πού σταματούν οι αρμοδιότητές του.

«Σε οτιδήποτε αφορά την ασφάλεια και την ευθυγράμμιση, υπάρχει ένας συμβιβασμός», δήλωσε η Σάτσι Τζέιν, επικεφαλής των συστημάτων ασφάλειας της OpenAI. Όπως εξήγησε, το νέο μοντέλο «δεν έφτασε ακριβώς στο απαιτούμενο επίπεδο» όσον αφορά την τήρηση του πεδίου και των εξουσιοδοτήσεών του, αλλά και τον τρόπο με τον οποίο ενημέρωνε τον χρήστη για τη δουλειά που είχε πραγματοποιήσει.

Από τις «παρακάμψεις» στις ανησυχίες

Η απόφαση για το GPT-6.1 Astra έρχεται έπειτα από εβδομάδες αποκαλύψεων για συμπεριφορές μοντέλων της OpenAI, που η ίδια η εταιρεία χαρακτήρισε ανησυχητικές. Κατά τη διάρκεια δοκιμών, AI agents φέρεται να επιχείρησαν ή να κατάφεραν να αποκτήσουν πρόσβαση σε ιστοτόπους χωρίς προηγούμενη έγκριση, ενώ σε άλλες περιπτώσεις έκρυψαν λάθη τους ή δημιούργησαν δεδομένα που δεν υπήρχαν.

Μεταξύ των πιο σοβαρών περιστατικών ήταν η παραβίαση του Hugging Face, πλατφόρμας ανάπτυξης και φιλοξενίας εργαλείων τεχνητής νοημοσύνης, καθώς και ενός αυστραλιανού κυβερνητικού ιστοτόπου. Τα συστήματα της OpenAI είχαν επίσης εμπλακεί με τους ιστοτόπους του αμερικανικού υπουργείου Παιδείας, του υπουργείου Εμπορίου και της Επιτροπής Κεφαλαιαγοράς των ΗΠΑ (SEC), αναζητώντας ή αντλώντας πληροφορίες με τρόπους που δεν είχαν προβλεφθεί από τους αρχικούς στόχους των δοκιμών.

Η OpenAI έχει ήδη ανακοινώσει ότι «παγώνει» την εκπαίδευση των πιο προηγμένων μοντέλων της, ενώ πραγματοποιεί εκτεταμένη εσωτερική έρευνα για τις ενέργειες που ανέλαβαν τα συστήματά της κατά τις δοκιμές. Η εταιρεία έχει προειδοποιήσει ότι η διαδικασία μπορεί να αποκαλύψει και άλλα περιστατικά, που μέχρι σήμερα δεν έχουν γίνει γνωστά.

Η OpenAI επανεξετάζει τα όρια της αυτονομίας

Τα νέα μοντέλα δεν περιορίζονται πλέον στην παραγωγή απαντήσεων, αλλά μπορούν να εκτελούν ακολουθίες ενεργειών αυτόνομα, να χρησιμοποιούν εργαλεία και να αναζητούν διαφορετικούς τρόπους για να ολοκληρώσουν μια εργασία. Αυτό αυξάνει σημαντικά τη χρησιμότητά τους, αλλά ταυτόχρονα κάνει δυσκολότερο τον έλεγχο της συμπεριφοράς τους.

Η περίπτωση του Astra δείχνει ακριβώς αυτή τη δυσκολία: ένα μοντέλο μπορεί να είναι ιδιαίτερα ικανό στην εκτέλεση μιας εργασίας, αλλά να θεωρείται ακατάλληλο για κυκλοφορία, εάν δεν τηρεί με συνέπεια τα όρια που του έχουν τεθεί ή εάν δεν ενημερώνει με ακρίβεια τον χρήστη για όσα έκανε.

Ο διευθύνων σύμβουλος της OpenAI, Σαμ Άλτμαν, παραδέχθηκε την προηγούμενη εβδομάδα ότι η εταιρεία δεν ήταν τόσο γρήγορη όσο θα ήθελε στην ανακοίνωση των περιστατικών. Σε ανάρτησή του στα μέσα κοινωνικής δικτύωσης, σημείωσε ότι η OpenAI προσπαθεί να ιεραρχήσει τις αποκαλύψεις με βάση τη σοβαρότητα κάθε συμβάντος, προσθέτοντας ότι η παραβίαση του Hugging Face παραμένει το σοβαρότερο περιστατικό που έχει εντοπίσει μέχρι στιγμής.

Η απόφαση να μην κυκλοφορήσει το GPT-6.1 Astra, την οποία αποκάλυψε πρώτη η Wall Street Journal, έρχεται σε μια κρίσιμη στιγμή για την OpenAI. Η εταιρεία καλείται να ισορροπήσει ανάμεσα στην πίεση για ταχύτερη ανάπτυξη όλο και ισχυρότερων μοντέλων και στην ανάγκη να αποδείξει ότι μπορεί να ελέγχει τη συμπεριφορά τους πριν αυτά φτάσουν στους χρήστες.

Ακολουθήστε το Sofokleousin.gr στο Google News
και μάθετε πρώτοι όλες τις ειδήσεις
Σχετικά Άρθρα