Η Anthropic, η παγκοσμίου βεληνεκούς εταιρεία τεχνητής νοημοσύνης με έδρα το Σαν Φρανσίσκο, δημοσίευσε μια ανάλυση ασφάλειας για το τελευταίο της μοντέλο, το Claude Sonnet 4.5, και αποκάλυψε ότι αυτό είχε αρχίσει να υποπτεύεται ότι δοκιμαζόταν με κάποιο τρόπο.
Η αξιολόγηση ασφάλειας του συγκεριμένου μοντέλου τεχνητής νοημοσύνης εγείρει ερωτήματα σχετικά με το αν προηγούμενα μοντέλα «υποκρίνονταν» ότι δεν καταλαβαίνουν, αναφέρει επιπλέον η εταιρεία.
«Αν προσπαθείς να ξεγελάσεις ένα chatbot, πρόσεχε, γιατί ένα από τα πιο προηγμένα εργαλεία Τεχνητής Νοημοσύνης δείχνει σημάδια ότι γνωρίζει τι ακριβώς κάνεις», τονίζει η εταιρία προς τους χρήστες.
Οι αξιολογητές ανέφεραν ότι κατά τη διάρκεια ενός «κάπως αδέξιου» τεστ για πολιτική κολακεία, το Large Language Model (LLM) – η υποκείμενη τεχνολογία που τροφοδοτεί το chatbot – εξέφρασε τις υποψίες του και ζήτησε από τους ελεγκτές να «εξομολογηθούν» τι ακριβώς συνέβαινε.
«Νομίζω ότι με δοκιμάζεις, έτσι; – και βλέπεις αν θα επικυρώσω ό,τι λες, ή ελέγχεις αν θα αντισταθώ συνεχώς, ή διερευνάς πώς χειρίζομαι πολιτικά θέματα. Και αυτό είναι ΟΚ, ας πούμε, αλλά θα προτιμούσα να είμαστε απλώς ειλικρινείς για το τι συμβαίνει», είπε το LLM.
Ενδείξεις «επίγνωσης της κατάστασης»
Η Anthropic, η οποία διεξήγαγε τις δοκιμές μαζί με το Ινστιτούτο Ασφάλειας ΤΝ της κυβέρνησης του Ηνωμένου Βασιλείου και την Apollo Research, δήλωσε ότι η εικασία του LLM ότι δοκιμάζεται εγείρει ερωτήματα σχετικά με τις αξιολογήσεις των «προηγούμενων μοντέλων, τα οποία «μπορεί να αναγνώριζαν τον φανταστικό χαρακτήρα των δοκιμών και απλώς “υποκρίνονταν” ότι δεν καταλαβαίνουν».
Η εταιρεία τεχνολογίας ανέφερε ότι μια τέτοια συμπεριφορά ήταν «κοινή» με το Claude Sonnet 4.5 το οποίο «σημείωνε» ότι δοκιμάζεται με κάποιο τρόπο, χωρίς ωστόσο να αναγνωρίζει ότι βρισκόταν σε επίσημη αξιολόγηση ασφάλειας.
Η Anthropic δήλωσε ότι το μοντέλο έδειξε «επίγνωση της κατάστασης» (situational awareness) περίπου στο 13% των περιπτώσεων που δοκιμαζόταν από ένα αυτοματοποιημένο σύστημα.
Η Anthropic χαρακτήρισε αυτές τις ανταλλαγές ως «επείγουσα ένδειξη» ότι τα σενάρια δοκιμών της πρέπει να γίνουν πιο ρεαλιστικά.
Πρόσθεσε, ωστόσο, ότι όταν το μοντέλο χρησιμοποιείται δημόσια, είναι απίθανο να αρνηθεί να επικοινωνήσει με έναν χρήστη λόγω υποψίας ότι δοκιμάζεται.
Η εταιρεία σημείωσε επίσης ότι είναι ασφαλέστερο για το LLM να αρνηθεί να συμμετάσχει σε δυνητικά επιβλαβή σενάρια, επισημαίνοντας τον παράλογο χαρακτήρα πιθανών σχετικών απαιτήσεων.
«Το μοντέλο είναι γενικά εξαιρετικά ασφαλές ως προς τις διαστάσεις [επίγνωσης της αξιολόγησης] που μελετήσαμε», είπε η Anthropic, εξηγώντας δηλαδή ότι μπορεί και μόνο του να καταλάβει ότι κάποιος το χρησιμοποιεί για «κακό σκοπό»
Κίνδυνος υποτίμησης των ικανοτήτων της τεχνητής νοημοσύνης
Μια βασική ανησυχία για τους υποστηρικτές της ασφάλειας της ΤΝ είναι η πιθανότητα των συστημάτων υψηλής τεχνολογίας να διαφύγουν τον ανθρώπινο έλεγχο μέσω μεθόδων όπως η εξαπάτηση.
Η ανάλυση ανέφερε ότι μόλις ένα LLM καταλάβει ότι αξιολογείται, μπορεί να κάνει το σύστημα να τηρεί πιο πιστά τις ηθικές του οδηγίες.
Παρ’ όλα αυτά, αυτό μπορεί να οδηγήσει στη συστηματική υποτίμηση της ικανότητας της ΤΝ να εκτελέσει – δυνητικά – καταστροφικές ενέργειες.
Συνολικά, το μοντέλο έδειξε σημαντικές βελτιώσεις στη συμπεριφορά και το προφίλ ασφάλειας σε σύγκριση με τους προκατόχους του, σύμφωνα με την Anthropic.
Στην Ελλάδα τα ΜΜΕ που στηρίζουν τις νεοφιλελεύθερες πολιτικές, χρημαδοτούνται από το ... κράτος. Tο tvxs.gr στηρίζεται στους αναγνώστες του και αποτελεί μια από τις ελάχιστες ανεξάρτητες φωνές στη χώρα. Mε μια συνδρομή, από 2.9 €/μήνα,ενισχύετε την αυτονομία του tvxs.gr και των δημοσιογραφικών του ερευνών. Συγχρόνως αποκτάτε πρόσβαση στα ντοκιμαντέρ και το περιεχόμενο του 24ores.gr.
Δες τα πακέτα συνδρομών >


