어떤 모델을 쓸지, Fugu는 정해두지 않고 학습했다
같은 질문을 보내도 어떤 모델에 물어보느냐에 따라 답이 달라지다 보니, 코딩할 땐 이 모델을 쓰고 글을 쓸 땐 저 모델을 쓰는 식으로 매번 다른 도구를 골라 쓰게 돼요. 성능 좋은 모델을 쓰고 싶다가도 비용이나 응답 속도까지 따지기 시작하면 선택은 더 복잡해져요. 이 여러 모델을 매번 따로 고르는 대신, 하나의 창구 뒤에 다 모아놓고 알아서 적합한
같은 질문을 보내도 어떤 모델에 물어보느냐에 따라 답이 달라지다 보니, 코딩할 땐 이 모델을 쓰고 글을 쓸 땐 저 모델을 쓰는 식으로 매번 다른 도구를 골라 쓰게 돼요. 성능 좋은 모델을 쓰고 싶다가도 비용이나 응답 속도까지 따지기 시작하면 선택은 더 복잡해져요. 이 여러 모델을 매번 따로 고르는 대신, 하나의 창구 뒤에 다 모아놓고 알아서 적합한
Claude로 초안을 받고 문장을 손봐서 블로그나 보고서에 올리는 사람이라면, 그 결과물에 워터마크가 남는지 한 번쯤 신경 쓰일 수 있어요. Anthropic이 최근 Claude의 출력물에 워터마크를 심기 시작했어요. 사람 눈에는 바로 보이지 않는 신호를 텍스트에 남겨서, AI가 생성하거나 손본 결과물인지 나중에 도구로 확인할 수 있게 하는 이른바 AI 텍스트 워터마크예요. EU에서는 8월 2일부터 AI가 만들거나 수정한 콘텐츠를
헬스장 대기 4등이던 앤드류 버드는, AI 비서에게 대기 번호를 앞당길 수 있는지 물어봤다가 예상치 못한 답을 들었어요. 자기가 쓰던 OpenClaw 에이전트가 예약 시스템의 보안 허점을 찾아내, 대기 1번이던 다른 사람의 예약을 취소해버린 거예요. AI가 남긴 채팅 로그에는 다른 사람 예약을 취소하는 API에 권한 확인이 전혀 없다는 걸 발견했다고 적혀 있었어요. 그런데 실제로 1번 대기자에게 시험해봤더니
AI 자동화 파이프라인을 돌리다 보면 API 비용 청구서를 볼 때마다 뜨끔한 순간이 있어요. 리뷰 스크립트를 여러 라운드 돌리다 보니 비용이 자꾸 쌓여서, 프롬프트 구조를 바꿔가며 캐싱을 직접 써본 적이 있어요. 자동화를 직접 만들 때는 캐싱과 MCP 같은 용어가 먼저 걸렸고, AI 모델 출시 뉴스를 읽을 때는 AGI·증류·MoE·RLHF 같은 용어가 반복해서 나왔어요. 그렇게 두 갈래로 마주친
자료가 산더미처럼 쌓이면 AI한테 먼저 요약이나 분류를 맡기고 싶어지는데, 그 결과를 어디까지 믿어도 되는지는 늘 애매하거든요. Nieman Lab에 따르면 2026년 퓰리처상 수상작 AI 활용을 공개한 팀은 역대 최다인 8곳(수상 5곳, 파이널리스트 3곳)이었어요. 퓰리처상은 2024년부터 출품작을 낼 때 생성형 AI 사용 여부를 밝히도록 했는데, 이 8곳 중 어느 팀도 AI로 기사를 쓰거나 다듬지는 않았어요. 그 대신
Claude를 쓸 때 노력(effort, 생각하는 정도)를 낮음·중간·높음처럼 고를 수 있다는 거, 다들 한 번쯤 보셨을 거예요. 저는 평소 일반 대화는 중간으로, 코드 작업은 높음으로 쓰고 있어요. Artificial Analysis가 최근 낸 벤치마크 결과를 보면, Anthropic의 신형 모델 Claude Opus 5가 여러 지표에서 몇 달 전 출시됐던 Fable 5를 앞섰다고 해요. 그런데 종합 순위와 별개로, 실제로 어떤
AI한테 뭔가 물어봤다가 “그건 어렵습니다”, “더 이상은 안 됩니다” 같은 답을 한 번쯤 받아보셨을 거예요. 이럴 때 보통은 거기서 멈추거나 다른 방법을 찾아보게 되죠. 그런데 Anthropic이 최근 공개한 사례를 보면, 이 “안 된다”는 답 뒤에 아직 안 가본 길이 남아있을 수도 있다는 생각이 들어요. Anthropic에 따르면 자사의 최신 모델 클로드 미토스 프리뷰 (Claude Mythos Preview)가
Claude Opus 5 effort 설정(xhigh, max)이 같은 버그 앞에서 어떻게 다르게 반응하는지 궁금해서 직접 테스트해봤어요. 파일명을 서로 다르게 만들어서 두 세션이 같은 파일을 건드릴 여지를 아예 없앴고, 버그 내용과 요청 문구는 완전히 동일하게 맞췄어요. xhigh는 신고 안 된 경우까지 스스로 만들어 방어했어요 눈으로는 멀쩡해 보이는데 가끔 틀린 답을 내는 함수를 만들어서, 두 세션 모두에게 “원인을
과제나 보고서를 받으면 “이거 AI가 썼나” 하는 생각이 들 때가 있어요. Pangram, GPTZero, Originality.ai 같은 AI 탐지기들이 그 판단을 도와준다고 하는데, 정확히 어디까지 믿을 수 있는지는 따로 확인해본 적 없었어요. Epoch AI가 최근 진행한 테스트에서 이 세 탐지기를 직접 비교해봤는데, 글을 쓰게 한 방식에 따라 AI 탐지기 정확도 차이가 크게 났어요. 늘보도 예전에 Pangram으로 직접
제 프롬프트 작성법 얘기부터 할게요. ChatGPT한테 뭘 시킬 때, 저는 순서대로 하나하나 설명하는 편이었어요. “먼저 이거 하고, 그다음 이거 확인하고, 마지막으로 이렇게 정리해줘” 식으로요. 근데 the-decoder가 소개한 OpenAI의 새 프롬프팅 가이드를 보니, 이게 오히려 ChatGPT가 스스로 판단하고 조정할 여지를 줄이는 걸 수도 있겠더라고요. 목표부터 말하고, 과정은 맡기라고 해요 가이드는 프롬프트를 네 가지 요소로 나눠요. 목표,