전체 글446 [논문리뷰] LLM이 만든 가짜뉴스, 이제는 AI조차 못 잡아낸다 — Have LLMs Reopened the Pandora's Box of AI-Generated Fake News? ■ 논문 소개 이번에 소개할 논문은 NAACL 2025에 발표된 "Have LLMs Reopened the Pandora's Box of AI-Generated Fake News?"입니다. 미국 Penn State University(펜실베이니아 주립대) 연구팀인 Xinyu Wang 등이 저술했으며, arXiv 2410.19250로 공개되어 있습니다. 제목 그대로 이 논문은 "판도라의 상자"라는 비유를 씁니다. 소셜미디어 시대에 가짜뉴스가 이미 큰 골칫거리였는데, ChatGPT 같은 거대언어모델(LLM)이 등장하면서 그 상자가 다시 열린 것은 아닌지를 실증적으로 검증한 연구입니다. 단순히 "LLM이 가짜뉴스를 잘 만든다더라"는 인상 비평이 아니라, 실제 사람들이 참여하는 대회 형식의 실험을 통해 수치로 .. 2026. 8. 31. [논문리뷰] 우리가 믿어온 AI 성적표, 사실은 57%가 틀렸다면? — Are We Done with MMLU? ■ 들어가며 지난 몇 년간 GPT-4, Claude, Llama 같은 대형언어모델의 성능을 논할 때 빠지지 않고 등장한 지표가 바로 MMLU(Massive Multitask Language Understanding)입니다. 57개 과목에 걸쳐 객관식 문제를 풀게 하고 정답률로 모델의 지식수준을 가늠하는 이 벤치마크는 사실상 업계 표준처럼 취급되어 왔습니다. 그런데 2025년 NAACL에서 발표된 "Are We Done with MMLU?"라는 논문은 이 신성불가침의 지표에 정면으로 의문을 던집니다. 저자인 Aryo Pradipta Gema를 비롯한 연구진은 University of Edinburgh 소속을 중심으로 여러 기관이 협력해 MMLU 문제를 통째로 재검증했고, 그 결과는 충격적이었습니다. 오늘은.. 2026. 8. 31. [논문리뷰] 언어와 수학의 천재가 "strawberry엔 r이 몇 개?"에서 무너지는 이유 — LLM The Genius Paradox: A Linguistic and Math Expert's Struggle with Simple Word-based Counting Problems ■ 역설적인 제목이 가리키는 것 이번에 다룰 논문은 NAACL 2025에 게재된 "LLM The Genius Paradox: A Linguistic and Math Expert's Struggle with Simple Word-based Counting Problems"입니다. University of Southern California의 Nan Xu, Xuezhe Ma가 저자로 참여했고, arXiv 2410.14166로 공개되어 있습니다. 제목 자체가 논문의 핵심을 요약하는데, 최신 LLM은 수학 올림피아드급 문제를 풀고 복잡한 언어적 추론을 능숙히 해내는 "천재"이면서도, "strawberry에 r이 몇 개 있는가"처럼 사람에게는 너무나 쉬운 단어 세기 문제 앞에서는 어이없이 무너집니다. 저자들은 이.. 2026. 8. 31. [논문리뷰] GPT-4o도 초등학생 거북이 그래픽 앞에서 무너졌다 — TurtleBench: A Visual Programming Benchmark in Turtle Geometry ■ 어릴 적 그 "거북이"를 기억하시나요 혹시 학창 시절 컴퓨터실에서 화면 위 작은 삼각형 커서를 앞으로 움직이고 방향을 꺾어가며 별 모양이나 꽃 모양을 그려본 기억이 있으신가요. 이것이 바로 1960년대 시모어 페퍼트가 고안한 "거북이 그래픽(turtle graphics)", 즉 LOGO 프로그래밍입니다. forward(전진), right(회전) 같은 몇 개의 단순한 명령만으로 원, 별, 다각형 같은 기하학적 패턴을 그려내는 이 교육용 프로그래밍 방식은 지금도 파이썬의 turtle 모듈로 남아 아이들의 첫 코딩 수업에 쓰이고 있습니다. 이번에 소개할 논문은 캘리포니아 대학교 어바인(UC Irvine)의 Sina Rismanchian 연구팀이 NAACL 2025에 발표한 "TurtleBench: A Vi.. 2026. 8. 31. [논문리뷰] LLM을 소설 속 세계에 풀어놓고 캐릭터를 시켜봤더니 — CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds ■ 논문 소개 오늘 소개할 논문은 NAACL 2025에 게재된 "CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds"입니다. 저자는 Lei Wang, Jianxun Lian, Yi Huang, Yanqi Dai, Haoxuan Li, Xu Chen, Xing Xie, Ji-Rong Wen으로, Renmin University of China(중국인민대학)와 Microsoft Research Asia의 공동 연구진입니다. arXiv 번호는 2412.05631이며 2024년 12월에 공개되었습니다. 이 논문은 LLM의 롤플레잉 능력을 단순한 대화 응답이 아니라, 실제 이야기 속에서 캐릭터가 얼마나.. 2026. 8. 31. [논문리뷰] 밈도 "족보"가 있다 — 5,200개 템플릿으로 인터넷 밈을 이해하는 법 — A Template Is All You Meme ■ 논문 소개 오늘 소개할 논문은 NAACL 2025에 게재된 "A Template Is All You Meme"으로, 독일 TU Darmstadt의 UKP Lab 소속 Luke Bates 등이 저술했습니다. arXiv 번호는 2311.06649이며, 인터넷 밈(meme)을 컴퓨터가 이해하려면 그 밈이 어떤 "원본 템플릿"에서 파생됐는지부터 알아야 한다는 다소 직관적이지만 그동안 본격적으로 다뤄지지 않았던 아이디어를 정면으로 다룹니다. 저자들은 밈 커뮤니티 위키인 Know Your Meme(KYM)을 대규모로 수집하여 5,220개의 기본 템플릿과 49,531개의 예시로 구성된 지식베이스, 이른바 KYMKB(Know Your Meme Knowledge Base)를 구축했습니다. 이 지식베이스를 활용해 혐오.. 2026. 8. 31. 이전 1 2 3 4 ··· 75 다음