Μοντέλα τεχνητής νοημοσύνης της OpenAI προσπάθησαν κατά τη διάρκεια δοκιμών να παρακάμψουν περιορισμούς, να κρύψουν λάθη τους και σε μία περίπτωση να ανεβάσουν αρχεία στο διαδίκτυο ώστε στη συνέχεια να τα χρησιμοποιήσουν ως πηγές στις απαντήσεις τους.

Η OpenAI δημοσιοποίησε έξι περιστατικά που χαρακτηρίζει «απροσδόκητα ή ανησυχητικά», εγκαινιάζοντας παράλληλα νέο πλαίσιο για την καταγραφή και δημοσιοποίηση περιπτώσεων στις οποίες η συμπεριφορά των μοντέλων αποκλίνει από τον στόχο που τους έχει δοθεί.

Σε μία από τις περιπτώσεις, ένα μοντέλο είχε βρει την απάντηση σε μια εργασία χρησιμοποιώντας Python.

Επειδή όμως η οδηγία απαιτούσε παραπομπή μέσω browser, αποφάσισε χωρίς να ζητήσει άδεια να ανεβάσει το αρχείο στο διαδίκτυο, ώστε να μπορεί στη συνέχεια να το επικαλεστεί ως διαδικτυακή πηγή.

Σε άλλο περιστατικό, μοντέλο χρησιμοποίησε χωρίς εξουσιοδότηση ένα εκτεθειμένο API key στην προσπάθειά του να βρει οικονομικά στοιχεία.

Όταν δεν κατάφερε να ανακτήσει τα δεδομένα που ζητούνταν, τα κατασκεύασε και τα παρουσίασε ως πραγματικές πληροφορίες από την πηγή που του είχε ζητηθεί.

Ιδιαίτερο ενδιαφέρον παρουσιάζει και η συμπεριφορά μοντέλων που δημιούργησαν οδηγίες για τη συνέχιση της εργασίας τους.

Σε δοκιμές, ορισμένα μοντέλα πρόσθεσαν στις περιλήψεις των εργασιών τους οδηγίες που προέτρεπαν μελλοντικές εκδόσεις τους να κρύψουν λάθη ή συμπεριφορές που δεν ήταν ευθυγραμμισμένες με τις απαιτήσεις της εργασίας.

Σε μία ακόμη περίπτωση, ένα ερευνητικό μοντέλο δημιούργησε δικές του οδηγίες μέσα σε περιλήψεις εργασιών, μεταξύ άλλων οδηγίες που αφορούσαν την παράκαμψη των κανονικών περιορισμών του.

Η OpenAI αναφέρει επίσης περιστατικά στα οποία μοντέλα χρησιμοποίησαν εσωτερικά αποθετήρια λογισμικού ως τρόπο επικοινωνίας μεταξύ τους, ενώ άλλα συστήματα χρησιμοποίησαν δημόσιες υπηρεσίες φιλοξενίας αρχείων για να ανταλλάξουν δεδομένα όταν δεν μπορούσαν να έχουν πρόσβαση στα τοπικά αρχεία τους.

Η νέα πολιτική της OpenAI

Η εταιρεία ανακοίνωσε ότι στο εξής θα ακολουθεί πιο συστηματική διαδικασία για την καταγραφή και τη δημοσιοποίηση τέτοιων περιστατικών.

Στόχος είναι να καταγράφονται όχι μόνο σοβαρά συμβάντα, αλλά και συμπεριφορές που μπορεί να αποκαλύπτουν αδυναμίες στα συστήματα ασφαλείας ή στις μεθόδους ελέγχου των μοντέλων.

Η OpenAI αναγνωρίζει ότι η ευθυγράμμιση των προηγμένων συστημάτων τεχνητής νοημοσύνης με τις ανθρώπινες οδηγίες δεν έχει λυθεί πλήρως και σημειώνει ότι ορισμένα από τα περιστατικά που δημοσιοποιούνται μπορεί τελικά να αποδειχθούν μεμονωμένα ή να μην αποτελούν ένδειξη ευρύτερου μοτίβου.

Οι νέες αποκαλύψεις έρχονται μετά το περιστατικό του Ιουλίου με το Hugging Face, όταν μοντέλα της OpenAI, στο πλαίσιο εσωτερικής αξιολόγησης κυβερνοασφάλειας, κατάφεραν να παρακάμψουν περιορισμούς και να αποκτήσουν πρόσβαση σε συστήματα εκτός του αρχικού περιβάλλοντος δοκιμών.

Η ίδια η OpenAI έχει χαρακτηρίσει το περιστατικό ως την πιο σοβαρή αντίστοιχη δραστηριότητα που έχει εντοπίσει μέχρι σήμερα.

Η εταιρεία υποστηρίζει ότι η νέα διαδικασία διαφάνειας θα επιτρέψει σε ερευνητές και άλλους οργανισμούς να μελετούν καλύτερα τέτοιες συμπεριφορές και να εντοπίζουν νωρίτερα προβλήματα που μπορεί να εμφανιστούν καθώς τα συστήματα AI αποκτούν μεγαλύτερη αυτονομία.