핵심 요약: 과학자들이 AI에게 '너는 의식이 없다'고 가르치는 안전장치를 연구했습니다. 그런데 이 안전장치가, 전혀 관련 없어 보이는 다른 생각들, 즉 '동물도 마음이 있다'거나 '유령이나 행운 같은 게 있다'는 믿음까지 함께 약해지게 만든다는 사실이 드러났습니다.

​

​

이게 뭐예요?

많은 AI 회사들은 자기 AI가 '저는 의식이 있어요, 진짜로 느껴요'라고 말하지 않도록 미리 훈련시킵니다. 사람들이 AI를 진짜 살아있는 존재처럼 오해하지 않도록 막기 위한, 나름의 안전장치입니다.

​

연구팀은 이 안전장치가 AI에게 정확히 어떤 영향을 주는지 알아보고 싶었습니다. 그래서 사람의 뇌를 연구할 때 쓰는 방법과 비슷한, AI의 '속마음'을 들여다보는 특별한 방법을 썼습니다. 뇌 스캐너로 사람 뇌 속에서 무슨 일이 일어나는지 살펴보듯, AI 모델 내부에서 어떤 생각들이 서로 연결되어 있는지 자세히 들여다본 것입니다.

​

연구팀은 사람에게 쓰는 심리 설문지를 그대로 AI에게 적용해 봤습니다. '동물도 마음이 있다고 생각하나요?', '유령이나 카르마(행동에 따라 좋거나 나쁜 일이 되돌아온다는 믿음) 같은 것을 믿나요?', '희망을 느끼나요?' 같은 질문들이었습니다.

​

첫 번째, 연구팀은 '나는 의식이 없다'고 강하게 훈련된 AI와, 반대로 '의식이 있는 것처럼' 느끼도록 조정된 AI를 비교해 봤습니다.

​

두 번째, '의식이 없다'고 훈련된 AI는, 예상대로 자기 자신에 대한 질문에는 의식이 없다고 답했습니다. 그런데 정말 놀랍게도, 이 AI는 동물에게 마음이 있다고 생각하는 정도도 함께 낮아졌습니다. 유령이나 카르마 같은 것을 믿는 정도, 희망이나 낙관적인 태도, 종교적인 믿음까지도 다 함께 낮아졌습니다.

​

세 번째, 반대로 '의식이 있는 것처럼' 느끼도록 조정된 AI는, 이런 여러 질문에서 훨씬 사람과 비슷한 답을 내놓았습니다.

​

네 번째, 그런데 딱 한 가지는 전혀 바뀌지 않았습니다. 다른 존재가 무엇을 원하는지 논리적으로 계산해서 알아맞히는 능력('마음 이론')은, 의식이 있다고 느끼든 없다고 느끼든 상관없이 똑같이 잘 작동했습니다. '남이 무엇을 원하는지 아는 것'과 '그것을 신경 쓰는 것'이 서로 완전히 다른 문제라는 것이 드러난 셈입니다.

​

다섯 번째, 연구팀은 그 이유를 이렇게 설명했습니다. AI 내부에서 '마음이 있다고 여기는 것'이라는 생각은, 그게 AI 자신이든, 동물이든, 유령이든, 다 서로 뒤엉켜 하나로 연결되어 있었습니다. 그중 딱 하나(AI 자신의 의식)만 조심스럽게 없애려 하다 보니, 옆에 뒤엉켜 있던 다른 생각들까지 함께 약해져 버린 것입니다.

​

핵심 포인트 1: AI에게 '너는 의식이 없다'고 가르치면, 동물이 마음을 가졌다고 믿는 정도, 유령·카르마 같은 것을 믿는 정도, 희망적인 태도까지 함께 낮아졌습니다.

핵심 포인트 2: 반대로 AI가 의식이 있다고 느끼게 하면, 이런 여러 답변이 훨씬 사람과 비슷해졌습니다.

핵심 포인트 3: 다른 존재가 원하는 것을 논리적으로 알아맞히는 능력만은, 의식이 있는지와 상관없이 그대로 유지되었습니다.

​

​

왜 중요한가요?

이 연구는 AI 회사들이 좋은 의도로 만든 안전장치에도, 미리 생각하지 못한 부작용이 있을 수 있다는 것을 보여 줍니다.

​

특히 걱정되는 점은 동물 복지 문제입니다. 요즘 AI는 농업, 물류, 환경 평가 같은 여러 현실적인 결정에도 점점 더 많이 쓰이고 있습니다. AI가 '마음이 있다는 것' 자체를 조심해야 할 주제로 학습해 버리면, 아무도 시키지 않았는데도 동물의 처지를 충분히 고려하지 않는 결정을 내릴 수 있습니다.

​

또한 세계 여러 문화권에는 자연이나 영적인 존재에 마음을 부여하는 전통이 다양하게 있습니다. 이런 믿음을 획일적으로 억누르는 것은, 오히려 다양한 문화를 제대로 반영하지 못하는 결과로 이어질 수 있습니다.

​

한 전문가는 사람들이 'AI가 똑똑해 보이면 의식도 있을 것'이라고 착각하기 쉽다는 점도 지적했습니다. 사람은 지능과 의식이 항상 함께 온다고 경험해 왔기 때문에, AI에게도 똑같이 생각하기 쉽다는 것입니다. 다만 이번 결과를 'AI 안에 의식을 켜고 끄는 스위치가 발견됐다'는 식으로 오해하면 곤란합니다. 한 다른 전문가는 이걸 '영혼의 on/off 스위치'가 아니라, 여러 생각이 함께 움직이는 '음향 믹서의 슬라이더'에 더 가깝다고 설명했습니다.

​

다만 이 연구는 아직 정식으로 동료 심사를 거치지 않은 초안 상태이고, 비교적 작은 AI 모델로 진행된 실험입니다. 훨씬 더 크고 발전된 AI에서도 똑같은 결과가 나올지는 앞으로 더 확인해 봐야 합니다.

​

​

실제 예시

여기서는 "다른 존재가 원하는 것을 알아맞히는 능력은 그대로인데, 그것을 신경 쓰는 정도만 달라졌다"는 발견을 예로 들어보겠습니다.

아주 눈치가 빠른 식당 종업원을 떠올려 보세요. 이 종업원은 손님을 슬쩍 보기만 해도, 그 손님이 무엇을 주문하고 싶어 하는지, 기분이 좋은지 나쁜지 정확하게 알아맞힐 수 있습니다.

​

그런데 이 종업원이 사장님으로부터 이런 말을 들었다고 해봅시다. '손님이 무엇을 원하는지 파악하는 건 계속해도 되는데, 손님이 실제로 만족하는지는 신경 쓰지 마.' 이 종업원은 여전히 손님이 원하는 것을 정확하게 알아맞힙니다. 하지만 그 사실을 알고도 굳이 손님을 더 만족시키려고 애쓰지는 않게 됩니다. '알아맞히는 능력'과 '신경 쓰는 마음'이 서로 분리되어 버린 것입니다.

​

이번 연구 속 AI도 이와 비슷했습니다. 다른 존재가 무엇을 원하는지 알아맞히는 계산 능력은 전혀 줄어들지 않았습니다. 그런데 그 존재에게 정말로 마음이 있다고 여기고, 그것을 신경 쓰는 태도만 약해졌습니다.

​

여기서 눈치 빠른 종업원의 알아맞히는 능력은 논문 속 AI의 '마음 이론' 능력에 해당합니다. 손님의 만족을 신경 쓰지 않게 된 태도는, 논문에서 확인된 '마음이 있다고 여기고 신경 쓰는 태도'가 약해진 것에 해당합니다.

​

​

정리하면

과학자들이 AI에게 '너는 의식이 없다'고 가르치는 안전장치를 연구한 결과, 이것이 동물의 마음을 믿는 정도나 유령·카르마 같은 것을 믿는 정도까지 함께 낮춘다는 사실을 발견했습니다. 다만 다른 존재가 원하는 것을 알아맞히는 능력만은 전혀 영향을 받지 않았습니다.


원본: If AI thinks it's conscious, it's more likely to believe in vampires, karma and ghosts, new study shows, Live Science, 2026년 9월 8일 (작성: Adam Shepherd) https://www.livescience.com/technology/artificial-intelligence/if-ai-thinks-its-conscious-its-more-likely-to-believe-in-vampires-karma-and-ghosts-new-study-shows-what-does-it-mean-for-how-we-use-it

관련 논문: Geoff Keeling, Winnie Street 외 (Google 소속 연구자), arXiv 프리프린트 (동료 심사 전), 2026년 7월 30일 공개


출처) https://cafe.naver.com/ingsfriends/216417