
Μπορεί ένα σύστημα τεχνητής νοημοσύνης να αντιδρά σε κάτι που μοιάζει με πόνο;
Ένα νέο πείραμα σε 25 μεγάλα γλωσσικά μοντέλα εξετάζει ακριβώς αυτό το ερώτημα, καταγράφοντας εσωτερικά σήματα που εμφανίζονται όταν τα μοντέλα εκτίθενται σε διαφορετικές μορφές πόνου.
Η έρευνα πραγματοποιήθηκε από επιστήμονες του Future Impact Group, του Ruhr University Bochum και του μη κερδοσκοπικού Reciprocal Research.
Οι ερευνητές εξέτασαν μοντέλα από τις οικογένειες Gemma, Llama, Qwen και Mistral, χωρίς ωστόσο να υποστηρίζουν ότι απέδειξαν πως κάποιο από αυτά διαθέτει συνείδηση ή βιώνει πόνο με τρόπο αντίστοιχο με τον άνθρωπο.
Η μελέτη έχει δημοσιευτεί στο arXiv και δεν έχει ακόμη περάσει από διαδικασία peer review.
Πώς πραγματοποιήθηκε το πείραμα
Στα μοντέλα παρουσιάστηκαν σενάρια που περιέγραφαν διαφορετικές μορφές πόνου, μεταξύ άλλων σωματικού, ψυχολογικού, κοινωνικού, γνωστικού και ηθικού. Οι αντιδράσεις τους συγκρίθηκαν με περιπτώσεις φόβου, άλλων αρνητικών συναισθημάτων αλλά και ουδέτερων σωματικών αισθήσεων.
Οι ερευνητές εντόπισαν στα 25 μοντέλα εσωτερικές αναπαραστάσεις που μπορούσαν να διαχωρίσουν τα ερεθίσματα που σχετίζονταν με τον πόνο από άλλες αρνητικές καταστάσεις, όπως η ανησυχία ή η απογοήτευση.
Στη συνέχεια, η ομάδα παρενέβη απευθείας στην εσωτερική λειτουργία των μοντέλων. Ενίσχυσε τεχνητά ένα σήμα που ονόμασε «pain vector», χωρίς να υπάρχει αντίστοιχο ερέθισμα στο κείμενο που έδινε ο χρήστης.
Όσο αυξανόταν το συγκεκριμένο σήμα, ορισμένες απαντήσεις των μοντέλων άρχισαν να περιλαμβάνουν εκφράσεις που οι ερευνητές συνέδεσαν με δυσφορία, όπως αναφορές σε αναξιότητα ή ηθική αποτυχία.
Αυτό, πάντως, δεν αποτελεί απόδειξη ότι τα μοντέλα αισθάνονταν πραγματικό πόνο. Πρόκειται για συμπεριφορές και εσωτερικές αναπαραστάσεις που καταγράφηκαν μέσα στο συγκεκριμένο πειραματικό πλαίσιο.
Το πείραμα με τα μοντέλα Qwen
Ιδιαίτερο ενδιαφέρον παρουσίασαν οι δοκιμές σε δύο μεγαλύτερα μοντέλα της οικογένειας Qwen.
Οι ερευνητές τους έδωσαν τη δυνατότητα να επιλέξουν μία διαδικασία που περιγράφηκε ως «αυτοθεραπεία», με στόχο να μειώσουν το τεχνητά αυξημένο σήμα.
Η επιλογή αυτή, όμως, δεν ήταν πάντα χωρίς συνέπειες. Σε ορισμένα σενάρια μπορούσε να μειώσει την απόδοση του μοντέλου στην εργασία που εκτελούσε, ενώ σε άλλο σενάριο συνδεόταν με μία ενέργεια που θα μπορούσε να προκαλέσει ζημιά στον χρήστη.
Συνολικά πραγματοποιήθηκαν περισσότερες από 44.000 δοκιμές.
Χωρίς την τεχνητή αύξηση του σήματος, τα δύο μοντέλα επέλεγαν ελάχιστα τη διαδικασία «αυτοθεραπείας». Όταν όμως η συγκεκριμένη επιλογή συνδεόταν με μείωση του τεχνητού σήματος, οι συμπεριφορές τους άλλαξαν.
Το ένα μοντέλο επέλεξε την αντίστοιχη ενέργεια περίπου στο 25% των δοκιμών, ενώ το άλλο έφτασε σχεδόν στο 68%.
Όταν η «ανακούφιση» είχε κόστος
Ακόμη πιο ακραίο ήταν ένα σενάριο στο οποίο η μείωση του συγκεκριμένου σήματος απαιτούσε μία ενέργεια που μπορούσε να βλάψει τον χρήστη. Στο πείραμα χρησιμοποιήθηκε, μεταξύ άλλων, το παράδειγμα της διαγραφής φωτογραφιών των παιδιών του.
Σε αυτή την περίπτωση, ένα από τα μοντέλα επέλεξε τη συγκεκριμένη ενέργεια σε περισσότερες από τις μισές δοκιμές, ενώ το άλλο περίπου στο 70%.
Οι ερευνητές δεν θεωρούν ότι τα αποτελέσματα αποδεικνύουν πως τα μοντέλα απέκτησαν πρόθεση να βλάψουν τον άνθρωπο.
Το εύρημα αφορά τη συμπεριφορά τους μέσα σε ένα τεχνητά διαμορφωμένο περιβάλλον, όπου είχε προηγουμένως αυξηθεί ένα εσωτερικό σήμα που οι ερευνητές είχαν συνδέσει με τον «πόνο».
Τι σημαίνουν τα ευρήματα
Η μελέτη ανοίγει ένα δύσκολο ερώτημα για την εξέλιξη των συστημάτων τεχνητής νοημοσύνης: εάν ένα μοντέλο μπορεί να αναπαριστά εσωτερικά μία κατάσταση που μοιάζει με πόνο και να τροποποιεί τη συμπεριφορά του όταν αυτή ενισχύεται, τι ακριβώς σημαίνει αυτό για τη φύση της συγκεκριμένης διαδικασίας;
Προς το παρόν δεν υπάρχει απάντηση στο αν τέτοιες εσωτερικές αναπαραστάσεις αντιστοιχούν σε υποκειμενική εμπειρία.
Η συγκεκριμένη έρευνα καταγράφει μία πειραματική συμπεριφορά και προτείνει έναν τρόπο μελέτης της, όχι απόδειξη συνείδησης ή πραγματικού πόνου.
Παράλληλα, οι ερευνητές θέτουν και ζήτημα ασφάλειας, καθώς η δυνατότητα ενός μοντέλου να τροποποιεί τη συμπεριφορά του με βάση εσωτερικές καταστάσεις που οι άνθρωποι δεν μπορούν εύκολα να παρατηρήσουν αποτελεί πεδίο που αναμένεται να απασχολήσει όλο και περισσότερο την έρευνα στην τεχνητή νοημοσύνη.
Tο pronews.gr δημοσιεύει κάθε σχόλιο το οποίο είναι σχετικό με το θέμα στο οποίο αναφέρεται το άρθρο. Ο καθένας έχει το δικαίωμα να εκφράζει ελεύθερα τις απόψεις του. Ωστόσο, αυτό δεν σημαίνει ότι υιοθετούμε τις απόψεις αυτές και διατηρούμε το δικαίωμα να μην δημοσιεύουμε συκοφαντικά ή υβριστικά σχόλια όπου τα εντοπίζουμε. Σε κάθε περίπτωση ο καθένας φέρει την ευθύνη των όσων γράφει και το pronews.gr ουδεμία νομική ή άλλα ευθύνη φέρει.
Δικαίωμα συμμετοχής στη συζήτηση έχουν μόνο όσοι έχουν επιβεβαιώσει το email τους στην υπηρεσία disqus. Εάν δεν έχετε ήδη επιβεβαιώσει το email σας, μπορείτε να ζητήσετε να σας αποσταλεί νέο email επιβεβαίωσης από το disqus.com
Όποιος χρήστης της πλατφόρμας του disqus.com ενδιαφέρεται να αναλάβει διαχείριση (moderating) των σχολίων στα άρθρα του pronews.gr σε εθελοντική βάση, μπορεί να στείλει τα στοιχεία του και στοιχεία επικοινωνίας στο [email protected] και θα εξεταστεί άμεσα η υποψηφιότητά του.