투명성 공개
방법론과 한계
이 도구가 왜 필요한지부터 보시려면 — 왜 유튜브 발언을 재는가. 이 페이지는 무엇을 어떻게 재는지를 적은 검증용 문서입니다.
데이터 출처
유튜브 정치 시사 매체 영상의 전사·발언을 분석합니다. 모든 카드의 주장은 실제 발언 인용에 근거하며, 인용을 클릭해 원문·타임스탬프로 검증할 수 있습니다.
모델 추정값
“모델 추정” 배지가 붙은 값(질문·요약·논조·영향력)은 LLM이 생성한 것으로, 측정값이 아닌 추정입니다. 근거 인용과 함께 읽어 주세요.
이념 분류
인물·채널에 붙는 진보·중도·보수 표시는 그 사람이 밝힌 이념이 아니라, 수집된 발언을 분석해 산출한 추정 분류입니다. 관리자가 임의로 지정하지 않으며, 발언이 쌓이면 값이 바뀝니다. 내부 점수는 −1(진보)에서 +1(보수) 사이의 값으로, −0.3 미만이면 진보, +0.3 초과면 보수, 그 사이는 중도로 표시합니다. 분류에 필요한 발언이 부족한 인물은 “미분류”로 둡니다. 각 인물 화면에서 분류의 근거가 된 발언을 확인할 수 있습니다.
무엇을 근거로 매기나 — 발언과 공개된 이력
판정에 넣는 것은 그 사람이 실제로 한 말과 공개된 이력(직책·경력· 출연 매체·자주 다룬 이슈)입니다. 발언은 음성으로 화자가 확인된 것만 씁니다.
발언만으로 매기지 않는 이유는 실측입니다. 이름·소속을 가린 채 발언만 주고 진영을 맞히게 했더니 발언이 적은 사람은 67%에 그쳤고, 같은 사람에게 직책·경력을 함께 주자 88%가 되었습니다. 발언이 많은 사람도75% → 96%로 올랐습니다. 사람이 판단할 때도 그 사람의 말과 이력을 같이 봅니다.
주지 않는 것도 정해 두었습니다. 이름을 가린 채 묻습니다 — 모델이 인물을 아는 것으로 답하면 그것은 측정이 아니라 인물 라벨링이기 때문입니다. 기존에 붙어 있던 성향 표시도 주지 않습니다. 이념을 물으면서 성향을 함께 건네면 답을 보고 답하는 셈이 됩니다.
발언은 최근 90일 안에서 뽑되, 한 사건에 몰리지 않도록 이슈당 최대 3건으로 끊고 기간을 나눠 고르게 뽑습니다. 그중 정책·가치 입장이 드러난 것만 남깁니다. 대담에는 판세 해설(“그 후보가 유리하겠죠”)과 인물 평가(“그러면 안 되죠”)가 많은데, 본인이 한 말이 맞아도 좌우를 알려 주지 않습니다. 이 걸러내기를 껐을 때 같은 설계의 적중이 96%에서 85%로 떨어졌습니다.
어떻게 갱신되나 — 있으면 바꾸고, 없으면 그대로
이념은 매일 일부씩 순서대로 다시 매겨, 대략 일주일에 한 바퀴 돕니다. 90일 발언이 20건에 못 미치는 사람은 대상에서 빠지고 마지막 값이 유지되며, 값이 없으면 미분류로 둡니다. 출연이 쌓여 문턱을 넘으면 다음 회차에 들어옵니다.
같은 재료로 물어도 언어모델의 답은 조금씩 흔들립니다. 그래서 매길 때마다세 번 물어 가운데 값을 쓰고, 그 값을 이전 값과 섞어 반영합니다. 한 번의 요동으로 배지가 뒤집히지 않게 하기 위해서입니다. 다만측정 방식을 바꾼 뒤 첫 판은 섞지 않습니다 — 방식이 다른 값끼리 섞으면 옛 값이 새 측정을 눌러 버립니다.
사람이 직접 지정한 값은 기계가 덮지 않습니다. 대신 발언으로 매긴 값과 크게 어긋나면 사람이 다시 보는 목록에 올립니다. 어느 쪽이 맞는지는 경우마다 다릅니다 — 자기 진영을 비판하는 사람은 발언만 보면 반대편으로 읽히고, 반대로 오래전에 지정된 값이 지금과 맞지 않기도 합니다.
채널도 같은 원리로 매기되, 채널은 스스로 말하지 않으므로 그 채널에 나온 사람들의 성향 분포와 최근 편성을 함께 봅니다. 다만 그 채널에서 확보된 발언 표본이 얇으면 분포는 쓰지 않습니다 — 두세 건이 편성 전체를 뒤집기 때문입니다.
지도로 보기 — 패널 이념 스펙트럼 · 채널 이념 스펙트럼
랭킹은 어떻게 매기나
이슈메이커는 지금 도는 이야기를 다루는 서비스입니다. 그래서 모든 랭킹의 뼈대는 같습니다 — 누적량이 아니라 최근에 얼마나 이야기되었는가. 오래된 발언은 시간이 지날수록 무게가 줄어듭니다.
이슈 · 채널
최근 14일의 검증된 발언을 반감기 24시간으로 시간감쇠 합산합니다. 하루가 지나면 무게가 절반이 되므로, 어제 크게 터졌더라도 오늘 조용하면 내려갑니다. 누적 발언 수로 세면 큰 채널·오래된 이슈가 고정되어 순위가 움직이지 않습니다.채널 랭킹은 같은 값을 채널 단위로 묶은 것이며, 기간 탭(오늘·주·월·전체)에 따라 합산 구간만 달라집니다.
패널
그 패널이 검증된 발언을 얼마나 냈는가를 반감기 21일로 감쇠 합산합니다. 이슈보다 반감기가 긴 이유는, 패널은 사건이 아니라 사람이라 하루 단위로 오르내리는 것이 오히려 실제와 어긋나기 때문입니다. 패널 목록에 오르려면 최근 90일·서로 다른 영상 3편 이상이라는 자격 조건을 넘어야 합니다.
이슈메이커(정치인)
단순 거론 횟수가 아니라 “얼마나 크고 뜨거운 논의의 재료가 되었는가”를 잽니다. 거론 한 건마다 그 시점 그 이슈의 열기로 가중치를 주어 합산합니다 — 조용한 이슈에서 열 번 불린 것보다 그날 가장 뜨거운 이슈에서 불린 쪽이 위로 옵니다.
여기에 두 가지 보정이 들어갑니다. 첫째, 자기 몫을 뺍니다. 빼지 않으면 자기 거론이 그 이슈를 뜨겁게 만들고 그 뜨거움이 다시 자기 점수가 되는 되먹임이 생깁니다. 둘째, 서로 다른 영상 2편 이상에서 불린 사람만 목록에 올립니다 — 한 방송에서 비유로 한 번 스친 이름이 상위로 튀는 것을 막습니다. 화면에 보이는 값은 1위를 100으로 둔 지수입니다.
규칙이 아니라 실제로 얼마나 손댔는지가 궁금하시면 — 이렇게 만듭니다에 순위·이념·영상 개입 건수를 전량 공개합니다.
연구는 우리에게 무엇을 말하나
저희 방식은 정치 텍스트를 수치로 옮기는 연구에서 검증된 방법을 이 서비스의 재료(유튜브 시사 대담)에 맞게 옮긴 것입니다. 그런데 그 연구들은 저희를 지지하기만 하지 않습니다. 다르게 하라고 말하는 것이 더 많습니다. 감추지 않고 적습니다.
① “이념은 콘텐츠가 아니라 청중으로 재라”
가장 큰 반론입니다. 유튜브 이념 추정의 대표 연구인 Lai 외 (Political Analysis)는 정답 자료를 레딧에서 누가 그 영상을 공유했는가에서 얻습니다. 한국 정치 유튜브 연구 (Technology in Society, 2025)도 주 신호가 댓글 이용자 활동입니다. Lai 외는 나아가 “텍스트만으로는 놓치는 것이 있다”고 명시합니다.
한국 자료를 보면 이 계열의 성질이 더 뚜렷해집니다. Tran 외 (SAGE Open, 2022)는 한국 정치 유튜브 채널 77곳 · 영상 약 3만 7천 편 · 이용자 60만 명 · 댓글 1,100만 건을 분석해 중립 이용자가 8%뿐이라고 보고했습니다. 그런데 채널의 이념은 댓글 이용자가 서로 겹치는지로 갈랐고, 저자들 스스로 “댓글 내용은 보지 않았다”고 적습니다. 즉 이 방식이 재는 것은 채널이 무슨 말을 했는가가 아니라 채널에 누가 모였는가입니다.
우리 답 — 첫째, 단위가 다릅니다. 청중 신호는 채널·영상에만 있습니다. 한 방송에 함께 나온 다섯 사람을 그 채널 청중으로 가를 수는 없습니다.개인의 성향은 본인이 한 말과 공개된 이력으로 잽니다.둘째, 레딧처럼 정파별로 갈린 대규모 공개 링크 공유 자료를 저희가 확보하지 못했습니다. 셋째, 청중 기반은 “누가 소비하는가”를, 콘텐츠 기반은“무엇을 말하는가”를 잽니다. 저희는 발언을 인용해 보여주는 서비스이므로 후자입니다. 덧붙여 Lai 외도 결국 텍스트 모델로 확장해 상관 0.891을 얻었습니다. 저희는 채널 단위의 제목·태그가 아니라 화자별 발언을 봅니다 — 대담 참여자 한 사람씩을 재는 데 맞는 재료이지만, 어느 쪽이 더 정확한지는 견주어 보지 않았습니다.
② “가운데는 원래 어렵다”
Lai 외의 사람 검증에서 이념 거리가 큰 쌍은 75% 이상 일치했지만 가까운 쌍은 그렇지 않았습니다. 저희 측정도 같습니다 — 양 끝은 정확하고 가운데가 흔들립니다.
우리 답 — 반박이라기보다 같은 성질의 확인입니다. 그래서 중도를 −0.3~+0.3으로 두어 애매한 자리는 애매하게 표시하고, 그 구간의 미세한 차이로 순위를 매기지 않습니다.
③ “언어모델은 비영어와 다분류에서 떨어진다”
Heseltine & Clemm von Hohenberg (2024)와 Törnberg (2025)는 짧은 정치 텍스트에서 언어모델이 전문가 코더에 근접한다고 보고하면서도, 긴 글에서 크게 하락(트윗 94.5% → 기사 80%대)하고 비영어에서 조금 낮으며3분류가 2분류보다 어렵다(94.5% → 81%대)고 밝힙니다. 저희 재료는 한국어이고 척도는 연속값이라 둘 다 불리합니다.
우리 답 — 긴 글 문제는 발언 한 토막 단위로 판정해 피합니다(그들이 높은 정확도를 보고한 조건과 같습니다). 한국어·다분류 불리는 인정합니다.대신 화면에 나가는 것은 세 칸이고 경계 근처는 중도로 흡수됩니다. 그리고 세 번 물어 가운데 값을 씁니다. 방향 검산은 이름·소속을 가린 채정당이 분명한 인물로 합니다 — 소속을 알려 주고 소속을 맞히게 하면 검산이 아닙니다.
④ “여러 번 묻고, 사람이 한 번은 손대라”
Le Mens & Gallego (2025, Political Analysis)는 문장 하나하나에 묻고 평균하는 방식으로 크라우드 평점과 상관 .90 이상, 정확도가 독립 코더 4명 이상에 해당한다고 보고했습니다. 위 Heseltine 연구는 한 걸음 더 나아가 두 번 코딩한 뒤 불일치를 사람이 조정하라고 권합니다.
우리 답 — 여러 번 묻는 것은 합니다. 다만 방식이 다릅니다 — 저희는 발언 20건을 함께 보여 한 번 판정받고, 그 판정을 세 번 반복해 가운데 값을 씁니다. 어느 쪽이 이 재료에 나은지 재어 보았습니다 — 같은 사람·같은 발언에서뭉쳐서 한 번 보는 쪽이 96%, 한 건씩 떼어 평균하는 쪽이 77%였습니다. 한 건씩 떼면 주제 선택과 일관성이 사라지기 때문으로 보입니다. 그리고 불일치 조정을 사람이 아니라 기계가 합니다. 사람이 개입하는 것은 기계 판정이 명백히 틀렸을 때 좌표를 직접 지정하는 경우뿐이고, 그 건수는 이렇게 만듭니다에 공개합니다.
⑤ “점수를 매기지 말고 둘씩 견주라”
Carlson & Montgomery (2017, APSR 111-4)는 절대 점수보다 쌍대비교가 안정적임을 보였고, 언어모델에 적용한 후속 연구도 있습니다(쌍대비교 채점, 언어모델 기반 이념점 추정).저희 화면 값은 여전히 좌표 기반입니다.
우리 답 — 시험했고 발언만으로 견줄 때 판정이 더 굳는 것을 확인했습니다. 다만 수백 명을 모두 둘씩 견주려면 비교 횟수가 급격히 늘어 지금은 검산에만 씁니다. 방향은 맞다고 보고 향후 과제로 남깁니다.
기댄 곳 · 정답표가 없다는 것
위 외에 기준점을 두고 상대 배치한다는 저희 앵커 구조는 정치 텍스트 척도화의 고전(Wordscores, Wordfish) 과 같은 계열이고, 위 한국 2025년 연구가 전문가 지정 기준 채널로 좌표를 잡은 것과도 같은 구조입니다. 발언 개수를 정할 때 쓴 겹치지 않는 두 벌 대조는 심리측정의 반분신뢰도와, 새 값을 이전 값과 섞는 것은 축소추정·지수평활과 같은 발상입니다.
다만 결정적인 차이가 하나 있습니다. 위 연구 대부분은 정답 자료(전문가 코딩, 의회 표결, 청중 행렬)를 두고 정확도를 잽니다. 저희에게는 “한국 시사 패널의 참 이념” 이라는 정답표가 없습니다. 그래서 정확도 대신 재현성(같은 사람을 다시 재면 같은 값이 나오는가)과 외부 정합(소속이 분명한 인물의 방향이 맞는가)으로 검증합니다. 후자는 현재 국민의힘 65명 중 64명 · 더불어민주당 55명 중 55명이 일치합니다.정확도의 증거가 아니라 큰 오류가 없다는 하한선으로만 읽어 주십시오.
폴(POLL)
카드의 “당신의 생각은?”은 참여자의 자발적 응답 집계입니다. 통계적 표본추출에 근거한 여론조사가 아니며, 결과는 어떤 결정에도 쓰이지 않습니다. 1기기 1표(무작위 기기 식별자)로 중복만 막고, 로그인은 요구하지 않습니다. 표가 없거나 참여하기 전에는 비율을 보여주지 않습니다 — 비어 있는 판을 살아있는 여론처럼 읽게 만들지 않기 위해서입니다.
중립성
특정 정파를 지지·반대하지 않습니다. 이슈 선정은 매체 언급량 기반이며, 카테고리 분류와 질문 생성은 자동화되어 있습니다. 오류 신고를 환영합니다.
한계
분석 대상은 수집된 매체에 한정되며, 이슈는 사건에 따라 생겼다 사라집니다. 장기 추세는 개별 이슈가 아닌 고정 카테고리 단위로만 의미가 있습니다.
이념 분류의 한계는 넷입니다. 첫째, 진영 안에서 자기 편을 비판하는 사람은 발언만으로는 반대편으로 읽히기 쉽습니다. “누구를 비판하는가”가 아니라 “무엇을 근거로 말하는가”를 보게 하고 있지만, 완전히 해결되지는 않았습니다. 둘째, 언어모델을 판정자로 쓰는 방식에는 제시 순서에 따라 답이 달라지는 편향 등이 보고되어 있고(Shi 외, 2025 — 판정자 15종·평가 15만 건 규모의 위치 편향 연구), 사람 코더와 체계적으로 다른 방향으로 치우칠 수 있다는 지적도 있습니다 — 개별 판정이 그럴듯해도 전체 분포가 사람과 다를 수 있습니다. 셋째, 발언이 적은 인물은 판정하지 않고 마지막 값이 오래 남습니다. 넷째, 저희가 쓰는 발언은 수집된 매체에서 나온 말일 뿐이므로, 그 사람이 다른 곳에서 한 말이나 실제 투표·정책 선택은 반영되지 않습니다. 다섯째 — 가장 근본적인 것으로 — 판정에 쓰는 언어모델 자체가 정치적으로 치우칠 수 있습니다. 모델이 편향을 탐지할 때 사람의 인식과 어긋난다는 연구 (LLM 기반 편향 탐지의 편향)와, 모델의 이념적 입장이 맥락에 따라 흔들린다는 연구 (언어모델의 이념적 가변성)가 보고되어 있습니다. 저희는 앵커·반복질의·외부 정합 검사로 이를 줄이려 하지만,없앨 수는 없습니다.
랭킹의 한계도 밝힙니다. 시간감쇠는 “지금 도는 이야기”를 드러내는 대신 조용히 오래가는 사안을 불리하게 만듭니다. 또 저희가 세는 것은 발언량이지 중요도가 아닙니다 — 많이 이야기된 것이 곧 중요한 것은 아닙니다.