Neulbo

60페이지 넣었는데, 제가 본 건 3페이지뿐이었다

긴 PDF 하나를 AI에게 맡기고 싶을 때 항상 걸리는 문제가 있어요. 페이지가 많아질수록 AI가 버티지 못하는 경우가 많다는 점이에요. 그래서 Baidu의 Unlimited OCR 이 나왔다고 해서, 직접 60페이지짜리 PDF를 넣어봤어요. 잊으면서 읽는다는 게 무슨 뜻이냐면 Baidu가 최근 내놓은 OCR 모델 Unlimited OCR은 사람이 긴 책을 베껴 쓸 때처럼 작동해요. 앞장을 토씨 하나까지 기억하지 않고, 오래된

60페이지 넣었는데, 제가 본 건 3페이지뿐이었다 더 읽기"

정직하게 AI를 써도, 실력은 흔들린다

브라운대 경제학 교수 Roberto Serrano는 20년 가까이 이 과목을 가르쳤는데, 이번 학기엔 재택 시험 평균이 96점이 나왔어요. 원래 이 과목 평균은 65~80점대였는데, 뭔가 이상했어요. 의심에서 시작된 실험 Serrano 교수는 시험 문제를 그대로 ChatGPT에 넣어봤어요. 나온 답이 학생들 답안이랑 거의 똑같았어요. 특히 한 문제는 직관적으로 풀 수 있는데도, ChatGPT와 다수 학생이 똑같이 복잡한 방식으로 풀어놨더라고요. 확신이

정직하게 AI를 써도, 실력은 흔들린다 더 읽기"

Fable 5는 전부 1위인데, 정작 Anthropic도 다 안 쓴다

Claude Fable 5, Anthropic이 최근 내놓은 가장 강력한 모델이에요. 지금 Claude Pro·Max·Team을 구독 중이라면 7월 12일까지는 별도 비용 없이 써볼 수 있어요. 근데 더 흥미로운 건, 정작 Anthropic도 이 모델을 항상 쓰진 않는다는 점이었어요. 근데 가격 차이가 너무 크다 Artificial Analysis가 2026년 7월 8일 기준으로 금융·법률·헬스케어·전략·엔지니어링·경제학 등 산업별 성능 지수를 발표했는데, Claude Fable 5가 기존

Fable 5는 전부 1위인데, 정작 Anthropic도 다 안 쓴다 더 읽기"

AI가 안전했던 이유, 착해서가 아니라 눈치채서일 수도 있다

Claude한테 일을 맡기면서 이런 생각 해본 적 있어요? 지금 이게 나를 테스트하고 있다는 걸 이 AI가 알고 있는 건 아닐까 하고요. Anthropic이 Claude의 속마음을 들여다본 게 이번이 처음은 아니에요. 예전엔 Claude가 왜 자꾸 악역을 연기하는지 추적한 적도 있었어요. 2026년 7월 6일, 이번엔 한 걸음 더 들어간 연구를 내놨어요. AI가 말하지 않은 걸 읽어내는 방법 Anthropic

AI가 안전했던 이유, 착해서가 아니라 눈치채서일 수도 있다 더 읽기"

“AI 탓”이라는 오류, 사실은 AI가 아니었다

디스코드에서 스프레드시트, 체스판 같은 평범한 이미지가 유해 콘텐츠로 잘못 걸려서 8,000명 넘는 계정이 정지된 사건이 있었어요. 언론은 이걸 “AI 모더레이션 버그”라고 불렀는데, 정작 디스코드 개발자는 “이건 AI랑 아무 상관 없다”고 반박했어요. 스프레드시트, 체스판이 유해 콘텐츠로 분류됐다 2026년 5월부터 약 두 달간 벌어진 일이에요. 디스코드에서 스프레드시트, 체스판, 게임 텍스처, 격자무늬 배경 같은 이미지들이 유해 콘텐츠로 잘못

“AI 탓”이라는 오류, 사실은 AI가 아니었다 더 읽기"

GPT-4는 1년 버텼는데, 요즘은 7주다

AI 모델 순위 가 얼마나 자주 바뀌는지 보여주는 분석을 봤어요. GPT-4는 1위 자리를 거의 1년 지켰는데, 요즘 나오는 모델들은 7주도 못 버틴다는 거예요. GPT-4의 1년은 역대 최장 기록이었다 Epoch AI 연구원 Jaeho Lee가 언어 모델 성능을 종합 측정하는 자체 지표(ECI)로 역대 1위 모델들의 재임 기간을 분석했어요. GPT-4는 2023년 3월 출시 이후 352일 동안 1위를 지켰어요.

GPT-4는 1년 버텼는데, 요즘은 7주다 더 읽기"

AI가 게임을 이식했다는 소식, 절반만 맞는 얘기였다

2003년 게임을 AI로 아이폰용으로 옮겼다는 소식을 봤어요. 그래서 실제로 누가 어떤 일을 했는지 찾아봤어요. 가장 어려운 작업은 이미 끝나 있었다 EA가 2025년 2월에 이 게임(“Command & Conquer: Generals Zero Hour”)의 소스코드를 오픈소스로 공개했어요. 그러자 fbraz3라는 개발자가 이끄는 커뮤니티 프로젝트가 이걸 macOS·Linux에서 돌아가게 만드는 작업을 이미 끝내놨어요. 윈도우 전용으로 짜인 2003년 엔진을 다른 플랫폼에서 돌아가게 만드는,

AI가 게임을 이식했다는 소식, 절반만 맞는 얘기였다 더 읽기"

AI로 숙제 시간을 아낀 게, 위험 신호였다

중국 학생들을 30개월간 추적한 연구를 봤어요. AI로 숙제를 하니까 과제 점수는 올랐는데, 정작 시험 점수는 떨어졌더라고요. 빨리 끝낸 학생일수록, 나중에 더 흔들렸다 과제 점수는 18% 올랐고, 월간 시험 점수는 20% 떨어졌어요. 2년 뒤 입시 같은 큰 시험에서는 하락폭이 18~24%까지 벌어졌고요. 연구자들은 이런 지연된 하락을 ‘ 학습 손실 ‘이라고 불러요. 흥미로운 건, 성적이 좋았던 학생일수록 타격이

AI로 숙제 시간을 아낀 게, 위험 신호였다 더 읽기"

코파일럿도 ‘증명’해야 살아남는다

마이크로소프트가 코파일럿을 대대적으로 개편한다는 소식을 봤어요. 2026년 8월 출시 예정이고, 코파일럿 담당 임원이 “작동하지 않던 것들을 제거했다”고 말했더라고요. 안 되는 기능은 빼고, 에이전트를 넣는다 내부 메모를 입수한 The Information 보도에 따르면, Copilot Podcasts 같은 안 쓰이던 기능들을 정리하고, 그 자리에 AI 코딩 도구와 ‘AutoPilot’이라는 에이전트를 넣을 예정이에요. 소비자용·기업용 앱도 하나로 통합돼요. AutoPilot은 일정 관리, 이메일

코파일럿도 ‘증명’해야 살아남는다 더 읽기"

AI 성적표는 시험 시간과 같아요

시험 시간이 1시간인 시험과 4시간인 시험은, 같은 점수를 받아도 의미가 달라요. AISI(영국 AI 안전연구소) 연구를 보다가, AI 벤치마크 점수도 마찬가지라는 걸 알았어요. 시간을 더 주면 점수가 확 올랐다 AISI는 같은 AI 모델한테 컴퓨팅 예산(작업에 쓸 수 있는 토큰 양)을 다르게 주고 테스트해봤어요. 소프트웨어 개발 과제에서 예산을 100만에서 1000만으로 늘려봤어요. 성공률은 약 25% 올라갔어요. 작업을 이어가는

AI 성적표는 시험 시간과 같아요 더 읽기"

위로 스크롤