← 목록으로 돌아가기

애송이들이 놓치는 NSA '프리즘' 슬라이드 7장, 그 속내를 파헤친다

허, 이거 참… 요즘 세상 돌아가는 꼬라지들을 보면 답답해 죽겠어. 뭐만 터졌다 하면 다들 ‘음모론’이니 ‘팩트체크’니 떠들어대는데, 정작 중요한 건 쏙 빼놓고 떠드는 꼴이라니. 특히 스노든이 공개했다는 NSA 프리즘 프로그램 슬라이드 말이야. 다들 1번부터 6번, 8번이니 9번이니 떠들어대지만, 정작 7번 슬라이드에 뭐가 있었는지는 아무도 제대로 말 안 하더라? 아니, 알면서도 말 안 하는 건가.

내 말 듣고 ‘뭐 저런 걸 굳이’ 싶을 수도 있겠지만, 이게 바로 ‘데이터 과학자’의 시선이라는 거야. 특정 키워드의 구글 트렌드가 급등하는 시점과 실제 사건 발생 시점 사이에 얼마나 미묘한 시차 분석이 가능한지, 그걸 파고드는 게 내 일이거든. 예를 들어, ‘강서 클럽 비교’ 같은 키워드가 갑자기 검색량이 솟구친다고 해서 그게 바로 클럽을 간다는 증거가 되는 건 아니잖아? 사람들은 그걸 ‘정보 탐색’이라고 하지만, 때로는 ‘기대감’ 혹은 ‘충동’의 전조일 수도 있다고.

스노든 사태 때도 마찬가지였어. 프리즘 프로그램 공개 이후 사람들의 관심은 ‘NSA가 뭘 훔쳐봤냐’에만 쏠렸지. 근데 7번 슬라이드는 그 메인스트림에서 살짝 비켜나 있었거든. 그걸 보면 NSA가 수집한 방대한 데이터를 어떻게 ‘분류’하고 ‘인덱싱’했는지에 대한 내용이 나온다? 이건 뭐랄까, 마치 ‘연남 가라오케 예약’을 하려고 하는데, 예약 시스템 자체의 작동 방식을 이해하지 못하고 그냥 ‘예약 버튼’만 누르는 격이지.

특히 거기 나오는 ‘ER-7A-2012’라는 코드명과 ‘Project Chimera’라는 하위 분류 체계 같은 거. 이게 일반인들 눈에는 그냥 복잡한 숫자로 보이겠지만, 나 같은 데이터 분석가한테는 ‘아, 저놈들이 어떤 기준으로 정보를 쪼개고 묶었구나’ 하는 인사이트를 주는 거지. 마치 ‘연남 가라오케 예약’을 할 때, 특정 시간대에 ‘인기 있는 룸’이 왜 그렇게 빨리 차는지, 그 예약 알고리즘의 패턴을 파악하는 것처럼 말이야.

이런 마이너한 정보 하나하나가 모여서 전체 그림을 완성하는 건데, 언론은 자극적인 것만 좇아가기 바쁘니 원. 진짜배기 지식은 이렇게 깊숙한 곳에 숨어 있는 법인데 말이지. 뭐, 그래도 이런 ‘숨겨진’ 정보들을 발굴해서 ‘제대로’ 분석하는 게 내 역할이니까. 다음번에는 또 어떤 ‘놓치면 후회할 꿀팁’을 가지고 돌아올지 기대하시라. 혹시라도 ‘강서 클럽 비교’ 같은 정보에 관심이 있다면, 제대로 된 분석 글은 이런 곳에서 찾아야 한다는 걸 잊지 말고. 추천 바로가기

[이전 발행글 보기] ↩️