AI
결정 모델, Jev와 Kev
텍스트 대신 확률을 돌려주는 모델 Jev가 나왔다. confidence는 학습된 값이 아니라 산술이고, calibration은 모델이 아니라 분포의 성질이다. 공개된 Jev 실측 5,743건과, 재현 구현 Kev를 이 블로그의 음차 게이트에 직접 돌린 결과로 확인한다.
LLM calibration과 overconfidence
calibration은 정확도가 아니라 자기가 몇 퍼센트 맞힐지 아는 능력이다. ECE가 그 어긋남을 어떻게 재는지, GPT-4 기술 보고서에서 post-training 뒤 ECE가 0.007에서 0.074로 나빠진 결과와 그 원인이 어디까지 밝혀졌는지 정리한다.
Harness(Systems) Engineering
프롬프트에서 컨텍스트 엔지니어링으로, 그 다음은 어디인가. Anthropic 엔지니어링 블로그의 최근 흐름을 단서로 harness 설계, eval, containment(격리) 세 방향과 토큰 절약 논의의 연결을 정리한다.
토큰 절약법
AI 코딩 도구의 토큰 비용은 어디서 발생하고 어떻게 줄일까. Anthropic 가격표와 prompt caching, subagent, MCP 다이어트, context engineering, Cursor Composer까지 절약 패턴을 React POC로 측정한다.
토큰의 원리
AI 토큰은 단어도 글자도 아니다. BPE 토크나이저가 토큰을 만드는 법, 토큰이 임베딩 벡터로 바뀌어 모델에 들어가는 과정, 입력보다 출력이 비싼 prefill/decode 구조, KV 캐시가 단가를 깎는 원리까지 비용의 뿌리가 되는 토큰 동작 원리를 정리한다.
Context file
CLAUDE.md, AGENTS.md, SKILL.md, Cursor rules가 언제 어떻게 에이전트에게 읽히는지 정리한다. user message 주입 구조와 context 망각, ETH Zurich 연구로 context file에 무엇을 적을지 기준을 세운다.
Code intelligence의 네 계층
AI 코딩 에이전트의 코드 탐색 비용을 줄이는 도구를 네 계층으로 비교한다. Repomix의 context packing, Aider의 tree-sitter repo map, CodeGraph 지식 그래프, Serena 같은 LSP 기반 도구가 코드를 얼마나 이해하는지 본다.
MCP와 function calling
MCP가 function calling과 무엇이 다른지 프로토콜 구조로 정리한다. 여섯 가지 primitive, stdio와 Streamable HTTP, tools/list에서 tool_use 루프까지의 흐름, Tool Poisoning 같은 보안 문제를 다룬다.
AI 프론트엔드 엔지니어
AI가 코드를 대신 짜는 시대, 프론트엔드 엔지니어는 어떻게 성장할 수 있을까? Karpathy의 agentic engineering, Vercel v0, METR 연구를 바탕으로 검증·명세·판단력 중심의 새 역량을 정리한다.