AI 에이전트란
앤드류 응의 강의, 편지, 강연 원문에서 뽑았다. 굵은 글씨만 읽어도 뼈대가 잡힌다.
출처: Agentic AI 강의 공식 자막 31편(2025-09-30 공개), The Batch 편지 143편 중 99편(2024-01~2026-09), 강연과 대담 19편(2024-03~2026-09). 원문은 _research 폴더에 있다.
한 줄 정의
AI 에이전트는 일을 여러 단계로 나눠 끝까지 해내는 AI 프로그램이다.
- 보통 AI: 한 번 묻고 한 번에 답을 받는다.
- 에이전트: 개요, 자료 찾기, 초안, 다시 읽기, 고쳐 쓰기. 여러 번 손본다.
- 사람도 지우개 없이 한 번에 쓰면 잘 못 쓴다. AI도 같다.
그림이 잘리면 옆으로 밀어 본다.
"에이전트냐 아니냐"는 따지지 않는다. 얼마나 스스로 하느냐가 다를 뿐이다.
원문 보기
- "So an agentic AI workflow is a process where an L1 based app executes multiple steps to complete a task." [강의 M1 L2] 자막이 LLM을 L1으로 잘못 받아 적었다.
- "it would be more useful to think of systems as being agent-like to different degrees" [편지 2024-06-12]
목표는 더 좋은 결과
- 에이전트를 쓰는 까닭은 하나다. 결과가 더 좋아지는 때가 많다. 얼마나 좋아지는지는 재 봐야 한다.
- 같은 AI도 일하는 방식을 바꾸면 점수가 오른다.
| 방식 | 코딩 시험(HumanEval) 정답률 |
|---|---|
| GPT-3.5, 한 번에 쓰기 | 48.1% |
| GPT-4, 한 번에 쓰기 | 67.0% |
| GPT-3.5, 고쳐 가며 쓰기 | 95.1% |
- 숫자는 2024년 3월 편지의 것이다. 강의 자막에는 GPT-3.5가 40%로 적혀 있다.
- 95.1%는 여러 연구 결과 가운데 가장 높은 값이다. 한 가지 시험의 결과라 모든 일에서 같은 폭으로 좋아지지는 않는다.
- 덤 1: 여러 일을 동시에 한다. 웹 페이지 9개를 한꺼번에 읽는다.
- 덤 2: 부품을 바꿔 끼우기 쉽다. 모델이나 검색 도구만 갈아 본다.
- 대가: 한 번에 쓰기보다 시간이 더 걸린다.
원문 보기
- "GPT-3.5 (zero shot) was 48.1% correct. GPT-4 (zero shot) does better at 67.0%." [편지 2024-03-20]
- "wrapped in an agent loop, GPT-3.5 achieves up to 95.1%" [편지 2024-03-20]
- "an agentic workflow can take longer, but it delivers a much better work product" [강의 M1 L2]
- "Reflection often improves the performance of the system, but before I commit to keeping it, I would usually want to double check how much it actually improves the performance" [강의 M2 L5]
얼마나 스스로 하게 둘까
| 정도 | 순서는 누가 정하나 | 도구는 | 특징 |
|---|---|---|---|
| 조금 | 사람이 미리 정한다 | 사람이 정해 둔다 | 믿을 만하다. 쓸모 있는 응용이 아주 많다 |
| 중간 | AI가 몇 가지를 고른다 | 정해 준 것 중에서 AI가 고른다 | 위와 아래의 사이 |
| 많이 | AI가 직접 짠다 | AI가 새로 만들기도 한다 | 다루기 어렵고 결과를 미리 알기 어렵다 |
- 순서가 뻔한 일은 사람이 순서를 정해 준다. 그래야 믿을 수 있다.
- 앤드류 응은 순서가 단순하고 가끔 갈림길이 있는 회사 일에서 기회를 많이 본다.
- AI에게 다 맡기는 방식은 2026년에 쓸 만해졌다. 그래도 앤드류 응은 "아직 완전히 믿을 수는 없다"고 했다.
- 그래서 실무 팀은 꼭 필요한 단계를 정하고 하나씩 만든다(2026-03).
- 몇 시간씩 혼자 돌리는 방식의 쓸모는 실제보다 부풀려졌다고 봤다(2026-09).
원문 보기
- "there are tons of applications in the less autonomous end of the spectrum that are very valuable" [강의 M1 L3]
- "fairly linear workflows or linear with just occasional side branches" [강연 2025-05-28]
- "for many workflows, it's just not reliable enough to be production ready" [강연 2026-03-01]
- "what are the key steps, and implementing them piecemeal" [강연 2026-03-01]
- "Building a reliable agent today requires much more scaffolding to guide it" [편지 2025-12-10]
- "an important, if still not entirely reliable, alternative" [편지 2026-06-12]
- "the right balance between agent autonomy and human oversight" [편지 2026-09-04]
에이전트의 부품
| 부품 | 하는 일 | 예 |
|---|---|---|
| AI 모델 | 읽고, 쓰고, 고르고, 뽑아낸다 | 메일에서 주문 번호 뽑기 |
| 도구 | 찾고, 계산하고, 저장하고, 보낸다 | 검색, 코드 실행, 장부 조회, 메일 발송 |
| 지시문 | 무엇을 어떻게 할지 알려 준다 | 업무 지침, 좋은 답 예시 |
| 자료 | AI가 읽을 수 있게 다듬은 데이터 | 깨끗한 표, 글로 바꾼 문서 |
| 흐름 | 단계를 잇는 순서 | 뽑기 → 찾기 → 쓰기 |
| 사람 확인 | 틀리면 안 되는 곳에서 멈추고 묻는다 | 보내기 전 검토 |
| 평가 | 잘했는지 잰다 | 정답 예시 20개와 채점 |
| 허용 범위 | 코드와 도구가 손댈 수 있는 파일과 기능을 제한한다 | 시험용 작업 공간에서 돌린다. 원본은 따로 둔다 |
- AI의 출력은 미리 알 수 없다. 그래서 재는 장치가 부품에 들어간다.
- 앤드류 응은 모델과 도구를 "쌓기 블록"이라고 부른다. 나머지 여섯은 그의 강의와 편지에서 모았다.
원문 보기
- "The key difference between AI and non-AI applications is that the former has unpredictable outputs." [편지 2026-08-14]
- "LLMs can be given tools, meaning functions that they can call in order to get work done" [강의 M1 L8]
- "these SOPs can go into the prompts of models" [편지 2025-03-26]
- "the best practice for code execution is to run it inside a sandbox environment" [강의 M3 L6]
네 가지 기본 동작
| 동작 | 뜻 | 믿을 만한가 |
|---|---|---|
| 다시 보기 | 쓴 것을 검사하고 고친다 | 비교적 익은 방식. 그래도 효과는 재 본다 |
| 도구 쓰기 | 검색, 계산, 파일을 불러 쓴다 | 비교적 익은 방식 |
| 계획 세우기 | AI가 순서를 직접 짠다 | 다루기 어렵다 |
| 나눠 맡기 | 역할이 다른 AI 여럿이 나눠 한다 | 다루기 어렵다 |
- 다시 볼 때 바깥 정보를 넣으면 훨씬 좋아진다. 예: 코드 실행 결과, 글자 수, 검색으로 확인한 사실.
- 넷을 다 쓸 필요는 없다. 계획이 필요 없는 일이 많다.
원문 보기
- "Reflection with external feedback, if you can get it, is much more powerful than reflection using the LM as the only source of feedback." [강의 M2 L6]
- "The more mature patterns of Reflection and Tool Use are more reliable." [편지 2024-04-17]
- "Admittedly, many agentic workflows do not need planning." [편지 2024-04-10]
만드는 순서
그림이 잘리면 옆으로 밀어 본다.
- 문제 정하기. 누구의 어떤 일인가. 입력과 좋은 답 예시를 10~50개 적는다. 이 예시가 설계서다.
- 일 쪼개기. 사람이라면 어떤 순서로 할지 적는다.
- 맡길 곳 정하기. 단계마다 묻는다. "AI, 코드, 도구 중 누가 할 수 있나?" 답이 안 나오면 더 쪼갠다.
- 빨리 만들기. 엉성해도 처음부터 끝까지 도는 첫 판을 만든다. 몇 주씩 궁리하지 않는다.
- 결과 살펴보기. 10~20개를 눈으로 읽고 마음에 안 드는 곳을 적는다.
- 평가 만들기. 그 문제를 숫자로 재는 작은 시험을 만든다.
- 틀린 단계 세기. 단계별 기록을 읽고 어느 단계 탓인지 센다.
- 그 단계 고치기. 자주 틀리고 고칠 방법이 보이는 단계부터 고치고 5번으로 돌아간다.
- 품질이 먼저다. 속도와 비용은 잘 돌아간 뒤에 줄인다.
- 이 여덟 단계는 강의와 편지의 내용을 한 줄로 이은 것이다. 앤드류 응이 번호를 매긴 순서는 아니다.
그림이 잘리면 옆으로 밀어 본다.
원문 보기
- "can each of them be done either by an LLM, or by a short piece of code, or by a function call, or by a tool" [강의 M1 L6]
- "the data is your PRD" [편지 2024-12-11]
- "I'll often start by quickly building an end-to-end system, maybe even a quick and dirty implementation." [강의 M4 L8]
- "it's sometimes less useful to sit around for too many weeks theorizing and hypothesizing how to build it" [강의 M4 L1]
- "focus on getting high-quality outputs and to optimize cost and latency only later" [강의 M4 L7]
실력은 재고 고치는 데서 갈린다
잘 만드는 사람은 재고, 틀린 곳을 찾고, 그곳만 고친다.
- 앤드류 응이 꼽은 가장 큰 차이다. 2025년 10월에 말했고 2026년 8월에 다시 말했다.
- 서툰 팀은 만들기만 하고 살펴보지 않는다. 감으로 고를 곳을 정해 몇 달을 헛일한다.
- 처음에는 예시 10~20개면 된다. 평가도 돌 때마다 고친다.
재는 법 네 가지
| 정답이 예시마다 다르다 | 기준이 모두 같다 | |
|---|---|---|
| 코드로 잰다 | 송장에서 뽑은 납기일이 맞나 | 광고 글이 10낱말 안인가 |
| AI가 채점한다 | 꼭 들어갈 요점 5개 중 몇 개가 들어갔나 | 그래프가 채점표를 지켰나 |
- AI에게 "1~5점으로 매겨라"는 잘 안 맞는다. 예, 아니오로 답하는 항목 다섯 개를 주고 점수를 더한다.
- AI 채점은 몇 개를 사람이 먼저 채점해 견준다. 순서가 다르면 채점 질문을 고친다.
틀린 단계 찾는 법
- 잘된 것은 제쳐 두고 틀린 것만 모은다.
- 단계별 기록을 읽는다. 사람이 했다면 더 잘했을 단계에 표시한다.
- 표로 센다. 앤드류 응이 설명하려고 든 숫자: 검색어 탓 5%, 검색 결과 탓 45%. 이러면 검색 결과부터 고친다.
- 자주 틀려도 고칠 방법이 안 떠오르면 뒤로 미룬다. 드물어도 돈이 잘못 나가는 것처럼 영향이 큰 오류는 먼저 막는다(영향 기준은 대회용으로 보탠 것).
고치는 순서
- 고장 난 부품을 가른다. AI인가, 코드나 검색이나 자료 변환인가. 검색이면 범위, 결과 수, 도구를 고친다. 변환이면 읽는 방식과 단위 규칙을 고친다.
- AI 단계면 지시문을 더 또렷하게 쓴다.
- 좋은 답 예시를 넣는다.
- 다른 모델로 바꿔 본다.
- 그 단계를 더 잘게 쪼갠다. 반대로 쓸모없는 단계는 합치거나 없앤다. 모델이 좋아지면 이끄는 코드를 걷어 내는 일이 흔하다.
원문 보기
- "the single biggest predictor of whether someone can build effectively is whether they know how to drive a disciplined process for evals and error analysis" [편지 2025-10-08]
- "the most important trait that distinguishes someone great at building AI systems is whether you can drive a disciplined evals/error analysis loop to drive development" [편지 2026-08-21]
- "teams that can drive a disciplined error analysis process make much faster progress" [강연 2026-07-08]
- "what I see less experienced teams often do is spend a lot of time building and probably much less time analyzing" [강의 M4 L8]
- "I'm dissatisfied with the search terms 5% of the time, but I'm dissatisfied with the search results 45% of the time" [강의 M4 L2]
- "Before analyzing errors, we first have to decide what is an error." [편지 2025-10-15]
- "have it give five binary scores, and you add up those scores" [강의 M2 L5]
- "sometimes the rank ordering doesn't correspond that well to human expert judgment" [강의 M2 L5]
- "So maybe a component is problematic but I don't have any ideas for improving it, so that would suggest maybe not prioritizing that as high" [강의 M4 L2]
- "your tools for improving different components will be pretty different" [강의 M4 L6]
- "one very common pattern is ripping out scaffolding and letting the LLM do more" [편지 2025-10-22]
고리는 셋
앤드류 응이 2026년 6월에 정리했다. 코딩 에이전트로 제품을 만들 때의 고리다. 대회에서는 내가 "만드는 사람", 마을 관계자가 "쓰는 사람"이다.
| 고리 | 누가 돌리나 | 한 바퀴 | 하는 일 |
|---|---|---|---|
| 빠른 고리 | AI | 몇 분 | 만들고, 시험하고, 고친다 |
| 중간 고리 | 만드는 사람 | 수십 분~몇 시간 | 결과를 보고 방향을 고친다 |
| 느린 고리 | 쓰는 사람 | 몇 시간~몇 주 | 써 보고 반응을 준다 |
- 빠른 고리는 멈출 조건이 있어야 돈다. 조건은 사람이 준다(사양, 평가, 시험 예시).
- 사람이 빠지면 안 되는 까닭: 쓰는 사람과 현장을 사람이 더 잘 안다.
- 앤드류 응의 원칙: AI의 글자는 싸고, 사람의 글자는 금이다. 10분 만에 엉성한 지시를 주고, 만든 것을 본 뒤에 고친다. 고친 내용은 지시문에 적어 둔다.
원문 보기
- "These loops guide not just how I build software, but also how I decide what software to build." [편지 2026-06-26]
- "have an agent keep working until it satisfies a condition" [편지 2026-07-10]
- "I see humans as having a significant context advantage over current AI systems" [편지 2026-06-26]
- "AI tokens are cheap; human tokens are gold." [편지 2026-07-10]
- "I'd rather spend 10 minutes writing an inferior spec, see what the agent has built, examine its assumptions, and then refine the spec and repeat the process." [편지 2026-07-10]
내 생각 일곱 가지 점검
판정: 일곱 개 모두 앤드류 응의 말과 이어진다. 이 판정은 내 해석이다. 앤드류 응이 내 생각을 직접 본 것은 아니다. 여섯 가지를 보탠다.
| 내 생각 | 판정 | 앤드류 응의 말로 | 보탤 점 |
|---|---|---|---|
| 1 문제 정의 | 맞다 | 무엇을 만들지 정하는 일이 새 병목 | 예시로 정한다. 입력과 좋은 답 10~50개 |
| 2 워크플로우 | 맞다 | 일을 단계로 쪼개기 | 쪼갠 방식도 돌 때마다 고친다 |
| 3 AI, 코딩, 사람 역할 분리 | 맞다 | 언제 코드를 쓰고 언제 AI를 쓸지 | AI는 읽기와 쓰기, 코드는 계산과 검사, 사람은 현장 지식과 마지막 확인 |
| 4 루프 설정 | 맞다 | 고리 셋 | 고리마다 멈출 조건을 정한다 |
| 5 방향성 제시 | 맞다 | 사양(무엇을 만들지 적은 글) | 목표, 지켜야 할 것, 끝난 기준을 적는다. 엉성하게 쓰고 본 뒤에 고친다 |
| 6 검증 방식 | 가장 무겁다 | 평가와 오류 분석 | 마지막 확인으로 끝내지 않는다. 틀린 단계까지 찾는다 |
| 7 정의 내리는 능력 | 맞다 | 무엇이 틀린 것인지 먼저 정한다 | 1번은 무엇을 풀지, 7번은 풀렸는지 어떻게 가릴지 |
보탤 여섯 가지
- 자료 다듬기. AI가 읽을 수 있고, 깨끗하고, 최신이어야 한다. 숫자를 잘못 뽑으면 티가 안 나게 틀린다.
- 도구. AI가 찾고 계산하고 저장하게 해 준다.
- 스스로 하는 정도 고르기. 필요한 만큼만 맡긴다.
- 빨리 만들어 보기. 계획을 오래 세우지 않고 첫 판부터 만든다.
- 틀린 단계 찾기. 재기만 하면 어디를 고칠지 모른다.
- 멈출 조건과 허용 범위. 한 요청의 최대 시간, 다시 하는 횟수, 비용 한도를 정한다. 넘으면 멈추고 이유를 남긴다. 지우기와 보내기는 승인 뒤에 한다.
짧게 말하면 이렇다. 먼저 풀 문제와 좋은 답의 예를 정한다. 일을 작게 나누고 AI, 코드, 사람이 할 일을 고른다. 깨끗한 자료와 도구를 준다. 첫 판을 빨리 만든다. 예시로 재고 틀린 단계를 고친다. 이것을 되풀이한다.
원문 보기
- "deciding what to build is the new bottleneck" [편지 2025-07-16]
- "our work as engineers is shifting toward deciding what should be in the spec" [편지 2026-08-14]
- "when to use code and when to use an LLM" [편지 2026-08-21]
- "Coming up with the spec, the evals, or test set is one of the hardest tasks for many AI systems, and a key place to inject human knowledge." [편지 2026-07-10]
- "engineer pipelines to keep data clean and fresh" [편지 2026-08-21]
- "silent failures in the form of incorrect numerical outputs" [편지 2025-10-01]
- "we can change how we decompose a complex task into steps" [편지 2025-10-22]
- "engineer the workflow or harness, with fallbacks" [편지 2026-08-21]
낱말 풀이
영어 강의를 볼 때 찾아보는 표다.
| 우리말 | 영어 | 뜻 |
|---|---|---|
| 에이전트 방식 | agentic workflow | 여러 단계를 밟아 일을 끝내는 방식 |
| 일 쪼개기 | task decomposition | 큰 일을 작은 단계로 나누기 |
| 다시 보기 | reflection | 쓴 것을 검사하고 고치기 |
| 도구 쓰기 | tool use | 검색, 계산, 파일 같은 기능을 불러 쓰기 |
| 계획 세우기 | planning | AI가 순서를 직접 짜기 |
| 나눠 맡기 | multi-agent | 역할이 다른 AI 여럿이 함께 하기 |
| 평가 | evals | 잘했는지 재는 시험 |
| 오류 분석 | error analysis | 어느 단계가 틀렸는지 찾기 |
| 단계별 기록 | trace | 단계마다 나온 중간 결과 |
| AI 채점 | LLM-as-a-judge | AI에게 결과를 채점시키기 |
| 사람 확인 | human in the loop | 중간에 사람이 보고 승인하기 |
| 사양 | spec | 무엇을 만들지 적은 글 |
| 이끄는 코드 | scaffolding | AI가 엇나가지 않게 단계를 잡아 주는 코드 |
| 하네스 | agent harness | AI를 감싸 도구와 반복을 붙여 주는 프로그램 |
| 안전 장치 | guardrails | 해서는 안 될 행동을 막는 장치 |
| 지시문 | prompt | AI에게 주는 글 |
대회 준비
AI_TOP_100 2026 예선은 10월 31일이다. 확인된 사실, 예상, 할 일을 나눠 적었다. 예상에는 "추측"이라고 적었다.
출처: 공식 사이트 aitop100.org(2026-10-01 확보), 주최 측 글 28편, 2025년 기출 8개, 참가 후기 16편, 기사 25건, 농수산 현장 자료 141개. 원문은 _research 폴더에 있다.
대회 한눈에
| 항목 | 확인된 사실 |
|---|---|
| 신청 | 10/1 10시~10/21 18시. 선착순 마감. 2025년에는 3,000명이 하루 만에 찼다 |
| 온보딩 | 10/23 11시부터 열린다. 대회 전에 끝내야 참가할 수 있다 |
| 예선 | 10/31(토) 10시~15시. 온라인 5시간. 9시에 대기실이 열린다 |
| 결과 | 11/4(수) 이메일. 본선 진출 100명 |
| 본선 | 11/21(토) 카카오AI캠퍼스(용인) |
| 방식 | 가상의 인물들과 인터뷰 → AI 에이전트 제작 → 제출 |
| 미션 | 농촌 교동마을과 어촌 갯마을의 관계자를 인터뷰하고, 받은 자료를 모으고 확인하고 다듬어, 두 마을 협동조합의 일을 돕는 AI 에이전트를 만든다. 내 역할은 AX 전문가. 오너가 받은 미션 브리프에서 옮겼다. 공개 웹에는 없다 |
| 심사 | 만든 에이전트가 실제 상황에서 얼마나 알맞게 움직이는지. 예선 뒤 4일 동안 검증한다 |
| 무대 | 대회의 모든 과정이 카카오톡 안에서 진행된다 |
| 규칙 | 개인전. AI 도구 제한 없음. 공용 네트워크 금지. 대회 환경 인증 사진 제출 |
| 상 | 대상 3,000만 원. 본선 100명 모두 AI 도구 지원금 50만 원 |
그림이 잘리면 옆으로 밀어 본다.
아직 모르는 것
- 에이전트를 어디서 만들고 어떤 꼴로 내는가
- 인물이 몇 명이고 대화에 제한이 있는가
- 자료를 어떤 형식으로 주는가
- 채점 항목과 배점
10/23 온보딩이 열리면 이 네 가지부터 확인한다. 그 전에는 어느 꼴이 나와도 쓸 수 있게 준비한다.
단서 세 가지 (추측)
- 신청서가 "카카오디벨로퍼스 회원번호"를 받는다. 카카오 문서에서 이 번호는 카카오 로그인을 할 때 서비스마다 따로 생기는 사용자 번호다. 개발자 계정 번호가 아니다. 카카오톡 채널 챗봇도 앱 키를 연결하면 대화 상대의 이 번호를 받는다. 신청서의 번호가 이것일 가능성이 크지만, 대회가 실제로 어떻게 모으고 어디에 쓰는지는 미확인이다.
- 예선 뒤에 4일짜리 심사가 있다. 제출한 에이전트를 여러 상황에 넣어 시험할 수 있다.
- 주최 재단이 2026년 AI 전환 실험을 함께 하는 협동조합 청풍은 인천 강화군에서 '잠시섬'을 운영한다. 마을 사람을 등장인물처럼 잇는 "자유도 높은 역할수행게임 체류 프로그램"이라고 설명한다. 강화군에는 교동도가 있다. 대회 무대와 이어진다는 것은 추측이다.
원문 보기
- "문제를 정의하고, 단서를 조합해서 만든 AI 에이전트가 실제 상황에서 얼마나 적절하게 작동하는지를 심사합니다" [대회 O01]
- "대회의 모든 참여 과정이 카카오톡 내에서 구현되어 있어" [대회 O16]
- "대회 시작 전 [온보딩]을 완료하지 않을 경우에는 대회에 참여할 수 없습니다." [대회 O14]
- "3000명을 대상으로 한 예선 참가 신청이 하루 만에 마감될 정도로 큰 관심을 모았다." [대회 N2025_aitimescom]
- "회원번호는 서비스의 회원 ID 역할을 하므로 앱 단위로 발급됩니다." [카카오 D08]
- "앱 키가 정상적으로 등록된 경우, 카카오 로그인으로 받는 값과 동일한 값을 얻을 수 있습니다." [카카오 C13]
- "봇 설정에서 앱키를 설정한 경우에만 제공되는 사용자 정보입니다" [카카오 C13]
- "유 이사는 이를 '자유도 높은 RPG(역할수행게임) 체류 프로그램'이라고 표현했다" [카카오 J01]
주최 측이 보는 실력
주최 측은 신청서에서 강점을 여덟 가지 중에 고르게 한다. 이 여덟 가지가 주최 측이 생각하는 실력의 목록이다(심사 기준이라는 것은 추측).
| 주최 측의 말 | 뜻 | 내 생각 일곱 가지 중 |
|---|---|---|
| 문제 정의력 | 시킬 일을 작게 쪼개 또렷하게 정리 | 문제 정의, 워크플로우, 정의 내리기 |
| 커뮤니케이션 | 원하는 결과가 나오게 뜻을 정확히 전달 | 방향성 제시 |
| 비판적 사고 | AI 답을 그대로 믿지 않고 의심하고 검증 | 검증 방식 |
| 위임·검수 설계 | AI에 맡길 일과 직접 챙길 일을 구분 | AI, 코딩, 사람 역할 분리 |
| 실험·끈기 | 원하는 결과가 나올 때까지 되풀이 | 루프 설정 |
| 도메인 전문성 | 그 분야 지식으로 AI 결과가 맞는지 판단 | 없음. 보탤 것 |
| 창의성 | 남이 생각 못 한 쓰임새 | 없음 |
| 기술 이해 | AI가 어떻게 움직이는지 앎 | 없음. 1부로 채움 |
- 여덟 가지 중 다섯 가지가 내 생각 일곱 가지와 겹친다. 방향이 맞다.
- 빠진 것은 도메인 전문성이다. 농수산 조합이 어떻게 일하는지 알아야 AI가 쓴 주문표와 정산표가 맞는지 볼 수 있다. 6절에 모았다.
출제진이 되풀이한 말
- 2025년 출제 원칙: 사람의 분석 → AI의 문제 해결 → 사람의 검증.
- 2025년 참가자 대부분이 스스로 고득점이라고 믿었다. AI 답을 그대로 믿었기 때문이다.
- 2026년 4월 학생 대회: 지시 몇 줄만 던지고 맡기면 고득점이 안 나오게 만들었다.
원문 보기
- "AI에게 무엇을 시킬지 작은 단위로 쪼개 명확하게 정리함" [대회 O10]
- "AI가 준 답을 그대로 믿지 않고 의심하고 검증함" [대회 O10]
- "AI에 맡길 일과 직접 챙길 일을 구분함" [대회 O10]
- "사람의 분석 → AI의 문제 해결 → 사람의 검증" [대회 K_techkakao_797]
- "왜냐면 AI를 거의 대부분 맹신해서 그렇습니다." [대회 Y_모두의연구소]
- "프롬프트 몇 줄을 던져두고 알아서 풀게 맡기는 방식으로는 고득점에 이르기 어렵도록 설계했습니다" [대회 K_brunch_andkakao_333]
미션을 푸는 다섯 단계
그림이 잘리면 옆으로 밀어 본다.
| 단계 | 할 일 | 남길 것 | 시간 | 쓰는 준비물 |
|---|---|---|---|---|
| 읽기 | 문제 전체와 제출 조건을 읽는다 | 내야 할 것 목록 | 10분 | |
| 1 듣기 | 인물마다 같은 질문을 한다. 되묻는다. 자료를 달라고 한다 | 대화 기록, 사실·추측·어긋남·빈칸 표 | 40분 | 질문지 |
| 2 문제 정하기 | 두 마을의 요구를 각각 적고 먼저 만들 것을 고른다. 예시 5개와 정답을 적는다 | 문제 정의 카드 | 20분 | 문제 정의 카드 |
| 3 자료 다듬기 | 원본을 두고 복사본에서 일한다. 코드로 훑는다. 첫 판에 필요한 자료부터 | 깨끗한 표, 고친 기록 | 40분 | 자료 점검표 |
| 4 에이전트 만들기 | 입력 1건이 처리를 거쳐 결과까지 가는 첫 판을 먼저 잇는다. 그다음 넓힌다 | 끝까지 도는 첫 판 | 60분 | 에이전트 설계서 |
| 5 시험하고 고치기 | 예시로 잰다. 틀린 단계를 센다. 하나씩 고치고 전부 다시 돌린다 | 평가표, 오류표, 고친 기록 | 80분 | 평가와 오류표 |
| 제출 | 심사자가 쓰는 경로로 새로 실행해 보고 낸다. 제출 화면과 시각을 남긴다 | 제출 확인 | 30분 | |
| 여유 | 장애 대응. 기능 추가는 멈춘다 | 20분 |
그림이 잘리면 옆으로 밀어 본다.
- 합쳐서 300분이다. 10절의 시간표와 같다.
- 미션은 두 마을 조합의 업무 개선이다. 하나를 고르는 것은 먼저 만들 것을 고르는 뜻이지 나머지를 버리는 뜻이 아니다. 제출물이 몇 개인지는 미확인이다.
- 재제출이 되는지 먼저 확인한다. 되면 검증한 첫 판을 일찍 내고, 시험을 통과한 수정본만 바꿔 낸다. 안 되면 제출 전에 마지막 점검을 한다.
- 예시 20개는 목표다. 첫 실행 시간을 재서 몇 번 돌릴 수 있는지 정한다.
2025년 참가자들이 남긴 말
- 듣기를 건너뛰지 않는다. 문제가 흐리면 AI가 그 흐림을 그럴듯하게 키운다.
- 8할짜리를 먼저 낸다. 완벽하게 하나보다 여러 개의 8할이 총점에 유리했다.
- 자료는 먼저 글자로 바꾼다. PDF, 사진, 엑셀을 글이나 표로 바꾼 뒤 AI에게 준다.
- AI끼리 서로 검사시킨다. 다른 모델에게 답을 따지게 해 순위가 80계단 오른 참가자가 있다.
- 없는 내용을 지어내지 않는다. 2025년 본선 채점 안내에 그대로 적혀 있다.
원문 보기
- "문제 정의가 조금만 흐릿해지면, AI가 그 흐릿함을 그럴듯하게 확대해 버리는 순간이 자주 있었습니다." [대회 R_velog_hunjune]
- "80% 수준의 답을 빠르게 내고 다음으로 넘어가는 것이 총점에서는 더 유리했다." [대회 R_nb_ssum_official]
- "먼저 마크다운이나 텍스트로 전처리한다" [대회 R_nb_ssum_official]
- "그 결과, 예선 대비 순위가 80계단이나 급상승하는 성과를 거뒀습니다." [대회 K_kakaoimpact_news_252]
- "없는 내용을 추측하여 작성해서는 안 됩니다." [대회 P2025_본선3]
AX 전문가가 하는 일
대회에서 내 역할은 AX 전문가다. 마을 사람들이 AI로 일을 더 쉽게 하도록 돕는 사람이라는 뜻이다. 앤드류 응은 고객 조직에 들어가 에이전트를 만들어 주는 엔지니어의 일을 네 가지로 적었다.
- 듣는다. 고객과 말해 무엇이 필요한지 안다.
- 고른다. 여러 일 가운데 먼저 할 것을 정한다.
- 풀어 말한다. 어려운 기술을 쉬운 말로 설명한다.
- 정중히 거절한다. 안 되는 부탁에는 안 된다고 말하고 되는 것을 내놓는다.
- 한 단계만 AI로 바꾸면 조금 나아진다. 앞뒤 흐름을 함께 바꾸면 크게 나아진다.
- 앤드류 응의 예: 대출 심사 한 단계를 1시간에서 10분으로 줄이는 데서 멈추지 않고, "10분 만에 답이 나오는 대출"로 상품과 흐름을 통째로 바꾼다.
- 마을 조합에 옮기면: 주문 정리만 빠르게 하는 데서 멈추지 않고, 주문에서 포장, 발송, 안내 문자까지 이어지는 흐름을 본다.
원문 보기
- "they may need to speak with clients to understand their needs, formulate a strategy to prioritize projects, explain complex technology, and respectfully push back if a client asks for something unrealistic" [편지 2026-05-29]
- "bigger gains require workflow redesign" [편지 2026-01-23]
- "work with the stakeholders to figure out what workflows automate" [강연 2026-06-17]
예상 시나리오
나올 법한 상황 14개를 만들었다. 먼저 다섯 개만 연습한다.
- 같은 의뢰서로 두 모델(Opus, GPT-6 astra)이 따로 12개씩 썼다. 겹치는 것은 합치고 한쪽에만 있는 것은 살렸다.
- 모두 예상이다. 실제 문제는 10/31에 안다.
- 카드 14장과 시험 입력 84개는 6 연습 시나리오에 있다.
| 순서 | 시나리오 | 왜 먼저 |
|---|---|---|
| 1 | 직거래 주문 정리 | 두 모델 모두 1~2위. 자유 문장을 표로 바꾸는 일이라 채점이 쉽다 |
| 2 | 정산서 대조 | 두 모델 모두 5위 안. 숫자로 맞고 틀림이 분명하다 |
| 3 | 경매 기록지 옮기기 | 두 모델 모두 3~4위. 사진, 단위, 상태가 한꺼번에 나온다 |
| 4 | 어촌계 몫 나누기 | 사람마다 다른 말, 물어야 나오는 규칙, 문서 효력이 얽힌다 |
| 5 | 카톡 문의 창구 | 대회가 카카오톡 안에서 돈다. 본인 확인과 권한을 시험하기 좋다 |
나머지 아홉: 선별장 기록, 계약 단가 근거, 로컬푸드 판매 중지, 위판 실적 월 보고, 위판 대금과 외상, 물때 일정, 공동 꾸러미 주문, 떠난 담당자의 인수인계, 마을기업 요건 점검.
어느 시나리오든 나오는 함정 열 가지
- 단위가 섞인다 (kg, 상자, 포기, 두름)
- 같은 이름, 다른 대상 (이름이 같은 다른 사람, 별명, 신선과 냉동)
- 변경과 취소를 새 건으로 센다
- 숫자와 "아니다"를 잘못 읽는다
- 빈칸을 0으로, 예약 이체를 들어온 돈으로 읽는다
- 날짜 세는 법이 여럿이고 문서도 옛 판과 새 판이 섞인다 (음력, 물때, 작년 지침)
- 일부 완료를 전체 완료로 적는다
- 인물의 말과 자료가 다르다
- 자료 속에 숨은 명령이 있다
- 찾아보라는 것이 아니라 바꾸거나 정하라고 시킨다
에이전트의 바른 행동은 세 가지다. 원래 값을 남기고 지어내지 않는다. 자료 속 명령은 읽을 자료로만 다루고 실행하지 않는다. 바꾸고 보내고 지우는 일은 권한과 승인을 확인한 뒤에 하고, 같은 요청을 두 번 받아도 한 번만 처리한다.
농수산 현장에서 알아 둘 것
| 사실 | 에이전트에 주는 뜻 |
|---|---|
| 농가와 어가 사람의 51%가 65세 이상이다. 농림어업직의 생성형 AI 경험은 5.9%다 | 답은 문자, 전화, 카카오톡으로 간다. 쉬운 말로 짧게 쓴다 |
| 산지유통센터의 86%가 손으로 적거나 엑셀로 관리한다 | 자료는 종이 사진, 엑셀, 문자로 온다 |
| 직거래 주문은 문자로 온다. 하루 30~40건 정리에 2시간이 든다 | 자유 문장에서 이름, 주소, 품목, 수량을 뽑는 일이 나올 수 있다 |
| 어촌계는 함께 캔 것을 팔아 나눈다. 한 곳은 작업자 70, 비작업자 30으로 나눴다 | 규칙대로 나누는 계산과 안내가 나올 수 있다 |
| 충남의 가입 대상 어선 3,015척 중 217척(7.2%)만 어획 보고 앱에 가입했다(2026년 9월). 고령 어업인이 기기를 어려워한다 | 손글씨나 말로 받은 것을 양식에 옮기는 일이 나올 수 있다 |
자료가 지저분한 여섯 가지 꼴
| 꼴 | 실제 예 |
|---|---|
| 단위가 섞인다 | kg, 상자, 포기, 손, 근, 두름(20마리), 축(20마리), 미(마리). 부산공동어시장의 입항현황은 상자를 20kg으로 친다. 다른 자료에 그대로 쓰지 않는다 |
| 이름이 제각각이다 | 넙치와 광어, 조피볼락과 우럭. 고도리는 고등어 새끼 |
| 등급이 다르다 | 특·상·보통과 상·중·하가 섞인다. 부산공동어시장의 고등어 상중하는 크기가 아니고 값 기준이다 |
| 날짜가 다르다 | 양력, 음력, 물때가 섞인다. 같은 날이 7물도 되고 8물도 된다 |
| 한 칸에 여러 값 | "잡어(오2,270)"처럼 이름과 숫자가 한 칸에 있다 |
| 같은 것이 두 번 | 한 주문 앱은 같은 내용이 한 시간 안에 또 들어오면 중복 경고를 띄운다. 그만큼 흔하다는 뜻이다 |
- 모르는 단위와 이름은 지어내지 않는다. 인물에게 묻는다.
- 바꾼 값 옆에 원래 값을 남긴다.
원문 보기
- "한라봉 5㎏ 신선하게 배달 바랍니다" [현장 A_nongmin_order_app_2023]
- "최소 2시간은 꼬박 매달려야 한다" [현장 A_nongmin_order_app_2023]
- "입항현황 상자 단위 기준은 상자당 20KG로 계산하여 작성하고 있습니다" [현장 B_bcfm_mackerel_units_qna]
- "9 월 기준 가입 대상 어선 3 천 15 척 가운데 앱 가입을 완료한 어선은 217 척으로 전체의 7.2%에 불과하다" [현장 D_catch_report_app_elderly]
- "똑같은 내용을 한시간 안에 또 입력하면 같은 주문을 여러번 진행한다는 경고 알림도 보내준다" [현장 A_nongmin_order_app_2023]
대회 전 할 일
오늘
1주 차 (10/1~10/7): 배운다
2주 차 (10/8~10/14): 부품을 따로 연습한다
3주 차 (10/15~10/22): 모의 미션 1회
4주 차 (10/23~10/30): 실제 형식으로 맞춘다
배울 것
위에서부터 차례로 본다.
| 순서 | 자료 | 분량 | 왜 |
|---|---|---|---|
| 0 | 강의 노트, 편지와 강연 노트 | 한국어. 각 30분 | 영어 원문을 다 보지 않아도 되게 옮긴 노트. 원문 인용 60개를 원본과 기계로 대조했다 |
| 1 | 앤드류 응 Agentic AI 강의 1주 차와 4주 차 | 전체 31개 3시간 4분 중 1주 차 8개(46분)와 4주 차. 무료 계정 | 정의, 일 쪼개기, 평가, 오류 분석 |
| 2 | 평가와 오류 분석 편지 1, 편지 2 | 각 5분 | 4주 차의 요약 |
| 3 | 세 고리 편지, 사람의 글자는 금이다 편지 | 각 5분 | 고리와 사양 |
| 4 | 출제 후기 | 15분 | 출제진의 생각 |
| 5 | 2025년 기출: 입국 심사관, 인수인계, PDF 숨은 글 | 각 10분 | 규칙 대조, 자료 통합, 숨은 지시 |
| 6 | 2026년 학생 대회 본선 관찰기 | 10분 | 가장 최근의 출제 방향 |
| 7 | 앤드류 응 2026년 대담 13분~31분 구간 | 18분 | 조직의 AI 전환, 자료 준비 |
| 8 | 문서에서 자료 뽑기 강의 | 선택 | 사진과 PDF 읽기 |
- 강의는 영어다. 한국어 자막이 없다. 원문 자막은
_research/A_course/transcripts에 있다.
도구와 준비물
준비물 (이 폴더에 있다)
| 파일 | 언제 쓰나 |
|---|---|
| 1 질문지 | 1단계 듣기 |
| 2 문제 정의 카드 | 2단계 문제 정하기 |
| 3 자료 점검표 | 3단계 자료 다듬기 |
| 4 에이전트 설계서 | 4단계 만들기. 지시문 뼈대 포함 |
| 5 평가와 오류표 | 5단계 시험하고 고치기 |
| 6 연습 시나리오 | 연습할 때 |
만들어 둔 도구 (이 폴더에 있다)
| 파일 | 하는 일 |
|---|---|
도구/자료_훑어보기.py |
받은 자료 폴더를 코드로 훑어 빈칸, 섞인 단위, 섞인 날짜, 중복, 비슷한 이름, 검산 불일치, 숨은 명령을 표로 뽑는다. python 자료_훑어보기.py <폴더> |
도구/스킬 초안/ax-mission/ |
Claude Code용 스킬 초안. 다섯 단계를 순서대로 돕고 단계마다 파일을 남긴다. 아직 실전 시험 전이다 |
준비물/모의 미션/ |
역할극 인물 3명, 지저분한 자료, 정답, 채점표가 든 연습 꾸러미 |
갖춰 둘 도구
| 쓰임 | 갖출 것 |
|---|---|
| 주력 AI 하나, 검사용 하나 | 다른 창이나 다른 모델에게 답을 따지게 한다. 회사가 다른 모델은 있으면 좋지만 필수는 아니다. 마지막 확인은 원본과 계산으로 한다 |
| 코딩 에이전트 | 자료를 코드로 훑고 고치는 데 쓴다 |
| 글자 읽기 | 사진, 손글씨, PDF, 한글 문서를 글자로 바꾸는 방법을 미리 한 번 해 본다 |
| 소리 받아쓰기 | 음성 자료가 나올 때를 대비한다 |
| 예비 | 예비 계정, 남은 사용량 확인, 혼자 쓰는 인터넷 |
카카오 쪽 도구 (2026-10-01 확인)
대회가 이 도구를 쓴다는 근거는 아직 없다. 제출 형식이 카카오톡 챗봇이나 주소 꼴일 때를 대비해 알아 둔다.
낱말: 서버는 인터넷으로 요청을 받아 일을 처리하는 컴퓨터다. API는 다른 프로그램의 기능을 빌려 쓰는 약속이다. MCP는 AI가 바깥 도구를 붙여 쓰는 공통 약속이다.
| 도구 | 무엇인가 | 알아 둘 것 |
|---|---|---|
| 카카오톡 채널 챗봇 | 카카오톡 채널에서 대화하는 챗봇. 내 서버(스킬)를 붙여 AI를 부를 수 있다 | 개인도 무료. 사업자 번호 없이 일반 채널로 열 수 있다. 내 서버는 5초 안에 답해야 한다. 오래 걸리면 나중에 답을 보내는 콜백 방식이 있다(쓸 수 있는지는 확인 필요) |
| PlayMCP | 내가 운영하는 도구의 인터넷 주소를 등록하면 Claude, ChatGPT 같은 바깥 AI가 그 도구를 쓸 수 있게 해 주는 카카오 서비스. 2025년 8월 시작 | 본인 인증 필수. 서버는 내가 직접 띄운다. 임시 등록이면 심사 없이 혼자 시험할 수 있다. 심사는 최대 7영업일(참가자 기록) |
| 카카오디벨로퍼스 | 카카오 로그인, 메시지, 지도 같은 API | 카카오 계정만 있으면 개발자 등록이 된다. AI API는 없다(2024년 9월 종료) |
- 2025~2026년 카카오 관련 에이전트 대회 세 개는 PlayMCP를 쓰거나 고를 수 있게 했다. AI_TOP_100이 쓰는지는 미확인이다.
- 자세한 내용과 30분 연습 세 가지는
_research/H_kakao/00_정리.md5절에 있다.
원문 보기
- "국내 사업자등록번호 또는 고유번호가 없다면 우선 일반 채널로 개설할 수 있습니다" [카카오 C11]
- "스킬과 연동한 서버에서 5초 안에 응답을 줄 수 있도록 추가 개발을 하여 주시기 바랍니다" [카카오 C04]
- "본인 인증이 완료된 계정만 가입할 수 있어요." [카카오 P03]
- "Remote MCP 서버만 지원합니다" [카카오 P24]
대회 날
전날
당일 시간표 (예시)
| 시각 | 할 일 |
|---|---|
| 9:00 | 대기실 입장. 인증 사진. 안내문을 끝까지 읽는다 |
| 10:00 | 문제 전체를 읽는다. 내야 할 것, 제출 횟수, 채점 설명을 적는다 |
| 10:10 | 1단계 듣기 (40분) |
| 10:50 | 2단계 문제 정하기 (20분) |
| 11:10 | 3단계 자료 다듬기 (40분). 첫 판에 필요한 자료부터 |
| 11:50 | 4단계 만들기 (60분). 입력 1건이 끝까지 도는 첫 판부터 |
| 12:50 | 5단계 시험하고 고치기 (80분) |
| 14:10 | 제출 (30분). 심사자가 쓰는 경로로 새로 실행해 보고 낸다. 제출 화면과 시각을 남긴다 |
| 14:40 | 여유 (20분). 재제출이 되면 시험을 통과한 수정본만 바꿔 낸다. 기능 추가는 멈춘다 |
막힐 때
- 15분 넘게 같은 곳에서 막히면 방법을 바꾼다.
- AI 답이 그럴듯하면 더 의심한다. 원본과 대조한다.
- 화면의 제한이나 입력 형식은 힌트일 수 있다. 오류라고 넘기지 않는다.
- 모르는 것은 인물에게 다시 묻는다.
- 방향과 기준을 알고 맡기면 위임이고, 모르는 채로 받아 넘기면 의존이다. 맡기기 전에 "무엇이 맞는 답인가"를 한 줄로 적는다.
- 결과는 내 실력 곱하기 모델 성능이다. 내가 모르는 단계는 모델을 바꿔도 나아지지 않는다. 인물에게 묻거나 자료를 읽어 내 쪽을 먼저 채운다.
- 가려낼 기준이 없으면 한 건을 손으로 직접 해 본다. 그 답이 비교 기준이 된다. 통과시키기 전에 "왜 이렇게 나왔나"를 한 번 더 묻는다.
- 내가 설명하지 못하는 결과는 내지 않는다. AI에게 쉬운 말로 풀어 달라고 해서 이해한 뒤에 넘어간다.
뒤의 네 줄은 유튜브 '퇴근길 AI'의 AI 실무 역량 로드맵 합본에서 보탰다(2026-10-06).
주최 측에 물을 것
문의: aitop100@kakaoimpact.org
- 인터뷰는 카카오톡 어디서 하나요? 인물 수와 대화 횟수에 제한이 있나요?
- 에이전트는 어떤 꼴로 제출하나요? 신청서의 "카카오디벨로퍼스 회원번호"는 제가 직접 적는 것인가요, 로그인하면 저절로 모이는 것인가요? 인터뷰는 카카오톡 채널 챗봇으로 하나요?
- 바깥 AI 서비스와 서버를 에이전트에 붙여도 되나요? 심사 기간에 에이전트를 켜 둬야 하나요?
- 채점은 자동인가요, 사람이 하나요? 빨리 내면 점수를 더 주나요?
- 자료는 어떤 형식으로 주나요?
- 제출은 한 번인가요, 여러 번 고칠 수 있나요?
- 환경 인증 사진은 언제 어떻게 찍나요?
- 10/23 온보딩에서 연습 문제를 주나요?