포스트

OASIS의 100만 AI 에이전트가 실제 여론을 예측할까: 소셜 시뮬레이션의 용도와 한계

OASIS의 100만 LLM 에이전트는 실제 100만 명의 여론을 대신하지 않습니다. 이 시스템의 강점은 추천 방식이나 초기 반응 같은 조건을 바꿨을 때 정보 확산이 어떻게 달라지는지 가상 환경에서 비교하는 데 있고, 현실의 미래를 그대로 예측하는 데 있지 않습니다.

OASIS 개요

OASIS의 결과는 실제 사회의 미래를 맞힌 예보가 아니라 정한 agent 성향, network, 추천 규칙 아래에서 나타난 시뮬레이션입니다. 규모가 커져도 잘못된 가정이 현실이 되지는 않으므로 조건 변화와 실제 관찰 데이터 대조가 필수입니다.

OASIS가 시뮬레이션하는 세 층

OASIS는 X와 Reddit을 닮은 환경을 만들고 게시물, 댓글, 좋아요, 공유, 팔로우 관계를 시간에 따라 갱신합니다. 단순히 에이전트 수만 늘린 것이 아니라 세 가지 층을 함께 둡니다.

LLM 기반 에이전트

각 agent는 프로필과 관심사를 바탕으로 글을 쓰고 다른 글에 반응합니다. 새 정보를 본 뒤 의견을 바꾸거나 인기 게시물에 반응하는 행동도 모델링합니다. 규칙표만 따르는 agent보다 다양한 텍스트를 만들 수 있지만, LLM이 만든 반응이 실제 사람의 행동과 같다는 보장은 아닙니다.

동적으로 바뀌는 관계망

에이전트는 관심사와 상호작용에 따라 follow, unfollow하고 새로운 community를 만듭니다. 고정된 network에서 정보만 흘리는 실험과 달리, 콘텐츠 노출이 관계를 바꾸고 바뀐 관계가 다시 노출을 바꾸는 순환을 관찰할 수 있습니다.

OASIS의 동적 네트워크

추천과 정보 확산

인기 기반 추천과 관심사 기반 추천을 환경에 넣어 agent가 무엇을 보게 될지 결정합니다. 같은 agent prompt를 써도 추천 규칙이 달라지면 정보 경로가 바뀔 수 있습니다. 따라서 결과는 agent 성향만이 아니라 recommendation system의 가정까지 포함합니다.

OASIS 구성 요소

이 세 층을 분리하지 않으면 원인을 잘못 해석하기 쉽습니다. 극화가 나타났을 때 LLM의 응답 성향, follow network의 동질화, 인기 콘텐츠 우선 노출 중 무엇이 영향을 줬는지 개별 실험이 필요합니다.

정보 확산, 극화, 군중 심리를 어떻게 실험했나

OASIS의 기본 실행 흐름은 다음과 같습니다.

1
2
3
4
5
플랫폼 형태와 추천 규칙 설정
→ agent profile, 관심사, 초기 관계 생성
→ 게시, 댓글, 좋아요, 공유 반복
→ 관계와 추천 결과 갱신
→ 확산 경로와 의견 변화 분석

OASIS 시뮬레이션 흐름

원문에는 세 종류의 실험이 소개됩니다.

  • X 형태의 환경에서 실제 tweet 198개를 이용해 전파 속도와 경로 비교
  • 특정 이슈를 두고 대화하면서 시간이 지날수록 의견이 극단화되는지 관찰
  • Reddit 형태에서 첫 upvote, downvote가 뒤따르는 반응에 미치는 herd effect 확인

초기 반응 실험의 장점은 조작 변수가 분명하다는 것입니다. 같은 댓글에 초기 평가만 다르게 주고 이후 반응을 비교할 수 있습니다. 반면 agent prompt나 추천 규칙까지 동시에 바꾸면 어떤 변화가 원인인지 알기 어려워집니다.

정책이나 추천 알고리즘을 비교하려면 최소한 다음 항목을 고정해야 합니다.

  1. agent profile과 초기 의견 분포
  2. 시작 network와 seed 콘텐츠
  3. LLM과 행동 prompt
  4. 실행 step 수
  5. 바꾸려는 추천, moderation 규칙 한 가지

같은 조건을 여러 번 실행해 결과의 변동도 봐야 합니다. 생성형 agent의 한 번 실행을 확정적인 사회 현상처럼 해석하면 안 됩니다.

90% 일치와 100만 규모를 어떻게 읽어야 하나

원문은 198개 tweet을 이용한 정보 확산 패턴이 현실과 90% 이상 일치했다고 설명합니다. 그러나 이 글에는 “일치”를 계산한 지표, 비교 기간, 기준 모델이 제시돼 있지 않습니다. 그러므로 90%를 “현실 행동을 90% 정확도로 예측한다”는 의미로 확대할 수 없습니다.

OASIS 실험 결과

agent 규모 비교에는 196명, 10,196명, 100,196명 조건이 제시됩니다. agent 수가 많아질수록 더 다양한 의견이 생성됐고, 소규모에서는 극단적 의견이 강화되는 반면 큰 규모에서는 더 다양한 시각이 나타났다고 설명합니다.

에이전트 규모별 비교

이 결과도 규모 효과만으로 단정하려면 조건이 필요합니다. agent 수를 늘릴 때 profile의 다양성, 관계 수, 노출량도 함께 늘었다면 어느 요소가 다양성을 만들었는지 분리해야 합니다. 최대 100만 agent를 실행할 수 있다는 확장성과 100만 명의 현실 사회를 타당하게 재현한다는 주장은 서로 다릅니다.

대규모 시뮬레이션은 드물게 생기는 확산 경로나 community 구조를 관찰할 기회를 늘리지만, 잘못된 행동 가정을 큰 규모로 반복할 수도 있습니다. 규모는 validity를 대신하지 않습니다.

OASIS로 답할 수 있는 질문과 답하기 어려운 질문

OASIS에 잘 맞는 질문은 조건 사이의 상대 비교입니다.

  • 인기 기반 추천과 관심사 기반 추천 중 확산 구조가 어떻게 달라지는가
  • 초기 downvote가 없을 때와 있을 때 후속 반응이 어떻게 달라지는가
  • 고정 network와 follow 변화가 있는 network의 polarization 차이는 무엇인가
  • 같은 정보가 X형과 Reddit형 상호작용에서 어떻게 퍼지는가

반대로 특정 정책을 시행하면 실제 국가의 여론이 몇 퍼센트 변한다거나, 특정 게시물이 현실에서 정확히 언제 viral이 될지를 이 글의 결과만으로 예측하기는 어렵습니다. 실제 사용자의 인구 구성, 플랫폼 규칙, 문화와 사건 맥락이 agent 설정에 얼마나 반영됐는지 검증이 필요합니다.

실용적인 연구 순서는 “현실을 복제한다”가 아니라 “가설을 좁힌다”입니다. 작은 agent 수로 변수와 측정 지표를 확인하고, 규모를 키워 network effect가 유지되는지 본 뒤, 실제 관찰 데이터와 비교합니다. 불일치가 나오면 agent prompt, 추천 규칙, 초기 network 중 어떤 가정을 수정할지 추적합니다.

OASIS의 가치는 인간을 LLM으로 대체하는 데 있지 않습니다. 현실에서 직접 조작하기 어려운 추천과 초기 반응을 통제된 가상 환경에서 반복하고, 실제 데이터로 검증할 가설을 만드는 데 있습니다.

시뮬레이션의 독립 변수를 하나씩 바꾼다

추천 알고리즘의 다양성, 초기 영향자 수, agent 성향, network 연결 중 하나를 바꾸고 나머지는 고정합니다. 결과에는 게시물 도달 범위, 반복 노출, 집단 간 거리, 특정 주장 채택률처럼 미리 정한 지표를 사용합니다. 모든 조건을 동시에 바꾸면 어느 규칙이 확산을 만들었는지 알 수 없습니다.

같은 설정도 random seed마다 결과가 달라질 수 있으므로 한 번의 viral pattern을 결론으로 쓰지 않습니다. 여러 반복의 평균과 분산, 극단 결과가 나온 빈도를 기록합니다. Agent 수를 늘릴 때도 작은 실험과 방향이 유지되는지 보고 compute와 memory가 늘어 얻는 안정성을 계산합니다.

현실 자료와 맞추는 Calibration

실제 platform의 공개 통계나 연구 자료에서 가능한 범위의 분포를 가져와 게시 빈도, follow degree, 반응률을 맞춥니다. 전체 결과가 90% 비슷하다는 표현보다 어떤 변수와 기간을 비교했는지 중요합니다. 한 사건에 맞춘 parameter가 다른 사건에서도 유지되는지 test해야 과적합을 줄일 수 있습니다.

LLM agent의 문장 자연스러움이 인간 행동의 타당성을 보증하지 않습니다. 같은 prompt에 비슷한 응답을 내거나 문화, 언어 집단을 단순화할 수 있습니다. Agent별 memory와 성향이 시간에 따라 어떻게 변하는지, 추천이 없는 대조군에서도 같은 극화가 나타나는지 확인해야 합니다.

OASIS로 답하기 좋은 질문

“특정 추천 규칙이 정보 다양성을 어떻게 바꾸는가”, “초기 반응이 같은데 network 구조가 다르면 확산이 어떻게 갈리는가”처럼 통제 가능한 비교에 적합합니다. “다음 선거 결과가 무엇인가”, “실제 사용자 한 명이 무엇을 할까”처럼 개인과 미래를 단정하는 용도에는 맞지 않습니다.

민감한 집단이나 허위정보를 시뮬레이션할 때는 결과가 실제 예측처럼 오용되지 않게 가정과 불확실성을 함께 공개합니다. 실제 사용자 데이터를 calibration에 쓴다면 익명화와 사용 범위도 별도 검토해야 합니다. OASIS의 가치는 결론을 대신 내는 데보다 현실에서 조작하기 어려운 조건의 가설을 좁히는 데 있습니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

100만 Agent면 실제 100만 명을 대표하나요?

아닙니다. 같은 모델과 설계 가정으로 만든 가상 행위자이며 규모가 현실 대표성을 자동으로 보장하지 않습니다.

OASIS로 여론을 예측할 수 있나요?

미래를 그대로 예측하기보다 추천, network, 초기 조건을 바꾼 비교 실험과 검증할 가설 생성에 적합합니다.

결과를 신뢰하려면 무엇이 필요한가요?

seed 반복, 변수 하나씩의 대조 실험, 실제 관찰 분포 calibration과 다른 사건에서의 재검증이 필요합니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    10개 장 17 분읽는 시간