AI 트렌드

최신 AI 뉴스, 업계 동향

GPT-4는 1년 버텼는데, 요즘은 7주다

AI 모델 순위 가 얼마나 자주 바뀌는지 보여주는 분석을 봤어요. GPT-4는 1위 자리를 거의 1년 지켰는데, 요즘 나오는 모델들은 7주도 못 버틴다는 거예요. GPT-4의 1년은 역대 최장 기록이었다 Epoch AI 연구원 Jaeho Lee가 언어 모델 성능을 종합 측정하는 자체 지표(ECI)로 역대 1위 모델들의 재임 기간을 분석했어요. GPT-4는 2023년 3월 출시 이후 352일 동안 1위를 지켰어요.

GPT-4는 1년 버텼는데, 요즘은 7주다 더 읽기"

코파일럿도 ‘증명’해야 살아남는다

마이크로소프트가 코파일럿을 대대적으로 개편한다는 소식을 봤어요. 2026년 8월 출시 예정이고, 코파일럿 담당 임원이 “작동하지 않던 것들을 제거했다”고 말했더라고요. 안 되는 기능은 빼고, 에이전트를 넣는다 내부 메모를 입수한 The Information 보도에 따르면, Copilot Podcasts 같은 안 쓰이던 기능들을 정리하고, 그 자리에 AI 코딩 도구와 ‘AutoPilot’이라는 에이전트를 넣을 예정이에요. 소비자용·기업용 앱도 하나로 통합돼요. AutoPilot은 일정 관리, 이메일

코파일럿도 ‘증명’해야 살아남는다 더 읽기"

AI 성적표는 시험 시간과 같아요

시험 시간이 1시간인 시험과 4시간인 시험은, 같은 점수를 받아도 의미가 달라요. AISI(영국 AI 안전연구소) 연구를 보다가, AI 벤치마크 점수도 마찬가지라는 걸 알았어요. 시간을 더 주면 점수가 확 올랐다 AISI는 같은 AI 모델한테 컴퓨팅 예산(작업에 쓸 수 있는 토큰 양)을 다르게 주고 테스트해봤어요. 소프트웨어 개발 과제에서 예산을 100만에서 1000만으로 늘려봤어요. 성공률은 약 25% 올라갔어요. 작업을 이어가는

AI 성적표는 시험 시간과 같아요 더 읽기"

AI 채점기는 순위는 맞췄지만 점수는 틀렸다

AI 에이전트가 실제 유료 프리랜서 작업을 전문가 수준으로 해내는 비율이 8개월 만에 2.5%에서 16.1%로 뛰었다는 연구를 봤어요. 근데 이 숫자보다 더 눈에 띄는 대목이 따로 있었어요. 채점은 원래부터 사람이 해왔다 이 수치는 Remote Labor Index(RLI)라는 벤치마크에서 나왔어요. 3D·CAD, 영상 편집, 데이터 분석 같은 프리랜서 프로젝트 240개(총 가치 14만 4천 달러)를 대상으로, 결과물이 전문가 수준인지 사람

AI 채점기는 순위는 맞췄지만 점수는 틀렸다 더 읽기"

AI는 22번, 날씨는 5번, 번개는 0번

미국 샌드위치 프랜차이즈 Jersey Mike’s가 상장 서류를 냈는데, 그 안에 AI(인공지능)라는 단어가 22번 나왔어요. 같은 서류에서 날씨는 5번, 번개는 0번이었어요. 처음엔 그냥 재미있는 숫자인 줄 알았는데, 서류를 읽어보니 더 흥미로운 건 횟수가 아니라 내용이었어요. 샌드위치 가게가 AI를 22번 언급한 이유 Jersey Mike’s는 그냥 샌드위치를 파는 회사예요. 소프트웨어(52번), 데이터(112번) 언급은 어느 회사나 하는 얘기라 그렇다 쳐도,

AI는 22번, 날씨는 5번, 번개는 0번 더 읽기"

Claude Code 추적 논란, 나는 상관없었어요

얼마 전 Claude Code에 중국 관련 환경을 감지해 보이지 않는 신호를 남기는 코드가 있었다는 얘기를 봤어요. 저도 매일 Claude Code로 이 블로그 파이프라인을 돌리고 있으니, 남 얘기로 넘기지 않고 제 것부터 확인해봤어요. 눈에 안 보이는 신호를 심어뒀다 이 코드가 하던 일은 이래요. 사용자의 시스템 시간대가 중국(상하이·우루무치)인지, 접속 경로가 중국 관련 서버를 거치는지 확인해요. 그 결과를

Claude Code 추적 논란, 나는 상관없었어요 더 읽기"

AI가 저 몰래 업그레이드됐어요

이 대화, 사실 오늘부터 Sonnet 5랑 하고 있었어요. 입력창 아래 모델 이름은 그대로 떠 있었어요. 근데 그동안 늘 같은 모델을 쓰고 있다고만 생각했지, 딱히 신경 쓴 적은 없었어요. 알고 보니 저 혼자 모르는 사이에 뭔가 달라져 있었던 거예요. 묻지도 않았는데 업그레이드됐어요 6월 30일, 앤트로픽이 Claude Sonnet 5를 출시했어요. 그리고 바로 그날부터 무료·Pro 요금제 사용자한테 기본으로

AI가 저 몰래 업그레이드됐어요 더 읽기"

1등 AI도 확인은 따로 해야 했어요

블로그를 운영하면서 AI한테 작업 기준이나 규칙을 정해준 적이 많아요. AI는 작업이 끝났다고 했지만 실제로는 규칙을 안 지킨 경우도 있었어요. 확인하지 않으면 그렇게 넘어갈 때가 있었거든요. 1등도 세 번 중 한 번은 실패했어요 프린스턴대학교 연구팀이 AI 경영 능력을 보려고, AI한테 가상 회사를 500일 동안 운영하게 시켰어요. 시작 자본은 100만 달러였고, 잔고가 0 이하로 떨어지면 그 자리에서

1등 AI도 확인은 따로 해야 했어요 더 읽기"

성능보다 평판이 먼저였다

생성형 AI를 처음 써본 건 ChatGPT였어요. 이 시장을 열었고, 지금도 가장 많은 사람이 쓰는 AI니까요. 근데 정작 지금 제가 매일 손이 가는 건 Claude예요. 성능을 직접 비교한 적도 없는데, 어느 순간 Claude를 쓰고 있었어요. 돌이켜보니, 주변 후기와 커뮤니티에서 Claude를 좋게 말하는 글을 계속 봤던 영향이 더 컸어요. 저만 그런 게 아니었어요 미국 소비자 약 2,800만

성능보다 평판이 먼저였다 더 읽기"

같은 A 안에서도 차이가 난다

A학점 비율이 13%포인트 늘었다는 연구가 나왔어요. AI 성적 인플레이션 이라는 말이 나올 정도였어요. 처음엔 그 정도구나 했는데, 읽을수록 제가 눈길이 간 건 다른 부분이었어요. AI를 못 쓰는 과제는 그대로였어요 UC버클리 연구팀이 한 미국 대학교에서 84개 학과, 319개 강좌, 8개 학기에 걸친 성적 50만 건 이상을 분석했어요. 작문이나 코딩처럼 과제 비중이 큰 수업에서, ChatGPT가 나온 뒤로

같은 A 안에서도 차이가 난다 더 읽기"

위로 스크롤