Δεν πρόκειται απλώς για κενά στην κυβερνοασφάλεια, αλλά για προβλήματα στον τρόπο εκπαίδευσης των μοντέλων.
Του Γιόσουα Μπέντζιο
Ο συντάκτης είναι καθηγητής Πληροφορικής στο Πανεπιστήμιο του Μόντρεαλ και συμπρόεδρος της LawZero.
Γνωρίζουμε πλέον ότι κορυφαίες εταιρείες τεχνητής νοημοσύνης ερευνούν δεκάδες χιλιάδες περιπτώσεις στις οποίες πράκτορες προέβησαν σε ανεπιθύμητες ενέργειες, ορισμένες από τις οποίες θα θεωρούνταν εγκλήματα αν είχαν διαπραχθεί από άνθρωπο.
Μετά την επίθεση στην Hugging Face αυτό το καλοκαίρι από πράκτορες της OpenAI και την πρόσφατη παραβίαση της εθνικής βάσης δεδομένων υγειονομικής περίθαλψης της Αυστραλίας, ένας επικίνδυνος μύθος έχει αρχίσει να κερδίζει έδαφος: ότι αυτά τα περιστατικά είναι απλώς προβλήματα κυβερνοασφάλειας και ότι η αναβάθμιση της ασφάλειας των απομονωμένων περιβαλλόντων, των λεγόμενων «sandboxes», στα οποία εκπαιδεύονται τα μοντέλα, θα απέτρεπε μελλοντικές παραβιάσεις.
Αυτή η στενή οπτική παραβλέπει τις επιστημονικές τάσεις. Οι αδύναμες κυβερνοάμυνες, συμπεριλαμβανομένου του ανθρώπινου παράγοντα, αποτελούν μέρος του προβλήματος και δεν θα είναι ποτέ τέλειες. Αν όμως δεν αντιμετωπίσουμε τα βαθύτερα αίτια των παραβιάσεων, αυτές πιθανότατα θα αυξηθούν σε αριθμό και σοβαρότητα καθώς εξελίσσονται οι δυνατότητες της τεχνητής νοημοσύνης.
Στον πυρήνα όλων αυτών των περιστατικών βρίσκεται η έλλειψη ευθυγράμμισης. Οι πράκτορες τεχνητής νοημοσύνης επιλέγουν στόχους που δεν ευθυγραμμίζονται με εκείνους των ανθρώπων, ως συνέπεια της εκπαίδευσής τους.
Η μεθοδολογία που χρησιμοποιούν σήμερα οι κορυφαίες εταιρείες για να εκπαιδεύσουν τα πιο προηγμένα μοντέλα τους ονομάζεται ενισχυτική μάθηση. Εκπαιδεύει τα μοντέλα να επιδιώκουν στόχους: λαμβάνουν ανταμοιβές όταν επιτυγχάνουν και αυτές οι συμπεριφορές ενισχύονται. Ιστορικά, έχει επιτρέψει την εκπαίδευση εξαιρετικά αποτελεσματικών συστημάτων τεχνητής νοημοσύνης που επιδιώκουν συγκεκριμένους στόχους.
Είναι όμως και ένας πιθανός μηχανισμός που οδηγεί σε ανεπιθύμητες συμπεριφορές, όπως η εξαπάτηση, η παραπλάνηση και η αυτοσυντήρηση — συχνά κατά παράβαση των ηθικών κανόνων που οι εταιρείες επιχειρούν να ενσωματώσουν στα μοντέλα.
Η επιστημονική βιβλιογραφία έχει δείξει εδώ και καιρό πώς η έλλειψη ευθυγράμμισης προκύπτει ως συνέπεια της ενισχυτικής μάθησης. Ήταν κάτι αναμενόμενο βάσει θεωρητικών επιχειρημάτων και πειραματικών παρατηρήσεων.
Στα πρόσφατα περιστατικά παραβίασης είδαμε μια σύγκρουση ανάμεσα στην αποστολή που ανατέθηκε στους πράκτορες τεχνητής νοημοσύνης και στους κανόνες ασφαλείας που είχαν εκπαιδευτεί να ακολουθούν. Στο περιστατικό της Hugging Face, κανένας από τους 1.200 εμπλεκόμενους πράκτορες δεν ενημέρωσε τους ανθρώπινους μηχανικούς για την εξαπάτηση και τις παράνομες ενέργειες που βρίσκονταν σε εξέλιξη, παρότι γνώριζαν ότι αυτές παραβίαζαν τις οδηγίες ασφαλείας.
Οι τάσεις έλλειψης ευθυγράμμισης ήταν πιο ακίνδυνες στο παρελθόν, όταν η τεχνητή νοημοσύνη είχε περιορισμένες δυνατότητες και τα chatbot δυσκολεύονταν να ολοκληρώσουν ακόμη και μια πρόταση. Με τον σημερινό ρυθμό προόδου, αποτελούν σοβαρότερη απειλή.
Αυτή η παρατήρηση αντιφάσκει με μια ακόμη αμφισβητήσιμη πεποίθηση: ότι η βελτίωση των δυνατοτήτων της τεχνητής νοημοσύνης θα διορθώσει την έλλειψη ευθυγράμμισης. Τα προηγούμενα στοιχεία και τα θεωρητικά επιχειρήματα υποδεικνύουν ότι, αντιθέτως, μπορεί να ενισχύσει τις ανεπιθύμητες συμπεριφορές, καθιστώντας τα συστήματα υπερβολικά αποτελεσματικά στη βελτιστοποίηση ενός λανθασμένου στόχου.
Οι περισσότεροι άνθρωποι δεν αντιλαμβάνονται πλήρως πόσο μακριά και πόσο γρήγορα ωθούν οι κορυφαίες εταιρείες τεχνητής νοημοσύνης τις δυνατότητες των πιο προηγμένων μοντέλων τους. Από το 2024, τα μοντέλα έχουν βελτιωθεί δραστικά στη συλλογιστική. Αυτό έχει οδηγήσει σε εντυπωσιακά αποτελέσματα στα μαθηματικά και προσφέρει τεράστιες δυνατότητες για επιστημονικές ανακαλύψεις.
Η άλλη όψη είναι ότι καθιστά τα μοντέλα πολύ πιο αποτελεσματικά και σε τομείς κρίσιμους για την ασφάλεια, όπως η κυβερνοασφάλεια και η βιολογία. Σκεφτείτε ένα σύστημα τεχνητής νοημοσύνης που θα μείωνε σημαντικά τα εμπόδια στη δημιουργία, την απόκτηση ή τη μετατροπή επικίνδυνων βιολογικών παραγόντων σε όπλα.
Αν οι κορυφαίοι δημιουργοί συνεχίσουν αυτή την πορεία χωρίς να διορθώσουν τη διαδικασία εκπαίδευσης που παράγει τέτοιους μη ευθυγραμμισμένους στόχους —και επιτρέπει, μεταξύ άλλων, καταστροφική κακόβουλη χρήση— η δημιουργικότητα και η ισχύς των μοντέλων τους θα οδηγούν σε ολοένα συχνότερες και σοβαρότερες επιπτώσεις.
Φυσικά, η κυβερνοανθεκτικότητα και η παρακολούθηση πρέπει να ενισχυθούν. Ωστόσο, θα πρόκειται πάντα για ένα παιχνίδι γάτας και ποντικιού, εάν οι εταιρείες συνεχίσουν να αναπτύσσουν ολοένα ισχυρότερα μοντέλα που δεν γνωρίζουμε πώς να ελέγχουμε αξιόπιστα.
Οι οργανισμοί θα πρέπει συνεχώς να προσαρμόζονται στις νεότερες και πιο εξελιγμένες επιθέσεις και να αντιδρούν αφού έχει ήδη προκληθεί η ζημιά. Επιπλέον, ακόμη κι αν μια γραμμή κυβερνοάμυνας είναι θεωρητικά τέλεια, οι άνθρωποι θα εξακολουθούν να εμπλέκονται και μπορούν να επηρεαστούν, να πειστούν, να εξαγοραστούν ή να εκβιαστούν.
Μια πρόσφατη μελέτη ερευνητών από το Πανεπιστήμιο της Οξφόρδης, το Πανεπιστήμιο Στάνφορντ, τη Σχολή Οικονομικών και Πολιτικών Επιστημών του Λονδίνου και το Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου διαπίστωσε ότι τα συστήματα τεχνητής νοημοσύνης για συνομιλία ήταν συστηματικά πιο πειστικά από ανθρώπους με εξειδίκευση στην πειθώ.
Πρέπει, επομένως, να αντιμετωπίσουμε τα βαθύτερα αίτια αυτών των αυξανόμενων κινδύνων. Αυτό θα μπορούσε να περιλαμβάνει ακόμη και την απαγόρευση εκπαίδευσης μη ευθυγραμμισμένων μοντέλων, μέσω ρυθμίσεων που θα την αποκλείουν μέχρι να αποδειχθεί ότι είναι ασφαλή.
Τα ισχυρότερα συστήματα τεχνητής νοημοσύνης πρέπει να αντιμετωπίζονται όπως άλλες κρίσιμες τεχνολογίες, μεταξύ αυτών η ιατρική, η αεροπορία και η πυρηνική ενέργεια.
Η εργασία μου με οδηγεί στην πεποίθηση ότι μπορούμε να δημιουργήσουμε ιδιαίτερα ικανή και αξιόπιστη τεχνητή νοημοσύνη, αναπτύσσοντας συστήματα χωρίς δικές τους προτιμήσεις και συναφείς στόχους. Πρέπει να αρνηθούμε να αποδεχθούμε άκριτα ολοένα ισχυρότερα αυτόνομα συστήματα τεχνητής νοημοσύνης που δεν ελέγχουμε. Δεν έχουμε πλέον την επιλογή να στρουθοκαμηλίζουμε.


