01 LLMOps: 설계-운영-평가, 유기적 순환의 큰 지도 LLMOps를 Design, Run, Trace, Evaluate, Improve가 연결된 운영 설계 학습 흐름으로 이해한다. KT AIVLE School
LLMOps
Agent 설계, HITL, Snapshot, Trace, 평가와 개선 루프를 따라가는 LLMOps 산문
- 원고
- 36
- 8월 25일-9월 24일
- 0편
01 LLMOps: 설계-운영-평가, 유기적 순환의 큰 지도 LLMOps를 Design, Run, Trace, Evaluate, Improve가 연결된 운영 설계 학습 흐름으로 이해한다.
02 LLMOps, 왜 그렇게 다른가? LLMOps가 모델 학습이 아니라 LLM 애플리케이션 운영 문제를 다루는 확장이라는 차이를 이해한다.
03 LLM 애플리케이션: '잘 작동'만으로는 부족한 이유 기능 성공과 운영 통제는 다르며 투명성, 재현성, 비용 예측, 안정성이 별도로 설계되어야 함을 이해한다.
04 LLMOps: 반복되는 루프 속에서 시스템을 통제하고 개선하기 설계, 실행, 관측, 평가, 개선이 반복되어야 LLM 시스템이 통제 가능해진다는 관점을 얻는다.
05 AI 개발에서 설계 없는 구현이 기술 부채가 되는 순간 AI 보조 개발에서도 설계 부재가 부채를 키우며, Agent 시스템에는 구조화된 설계가 먼저 필요함을 이해한다.
06 AI Agent 시스템: 설계 문서, 형식인가 핵심인가? 각 문서가 구현 전에 어떤 불확실성을 줄이는지 이해한다.
07 AI 면접관 Agent 예제로 보는 문제, 목표, 시나리오 정의 문제와 목표가 정해진 뒤 역할과 workflow가 자연스럽게 분해되는 흐름을 이해한다.
08 Agent 역할 정의서: 예측 가능한 시스템을 위한 책임 경계 설계 역할 정의서는 누가 무엇을 받고 무엇을 내보내는지 정해 예측 가능한 시스템을 만든다는 점을 이해한다.
09 Workflow Spec: 시스템의 흐름을 계약처럼 고정하기 Workflow Spec이 실행 순서, 조건, 반복, 종료를 구현 전 계약으로 고정한다는 점을 이해한다.
10 Agent 시스템을 위한 State 정의서: 데이터 혼란을 계약으로 바꾸는 방법 State는 Agent 사이에서 합의된 데이터 계약이며 key, 타입, reducer/overwrite, 사용 Agent가 문서화되어야 함을 이해한다.
11 Decision Policy로 워크플로우의 흐름을 읽고 통제하기 반복, 종료, 재시도, HITL 전환 같은 정책을 문서로 분리해야 원인 추적과 통제가 쉬워진다는 점을 이해한다.
12 LLM 응답, 예측 불가능에서 재현 가능으로: Prompt Spec의 역할 Prompt Spec이 역할, 작업 지침, 평가 기준, 출력 형식을 고정해 품질 편차를 줄인다는 점을 이해한다.
13 계약서 자동 분석 POC: 설계 문서 묶어보기 하나의 POC에서 역할 정의서, Workflow, State, Decision, Prompt가 함께 맞물리는 방식을 이해한다.
14 AI Agent 시스템: Planner, Executor, Critic으로 복잡한 문제 정복하기 Planner는 계획, Executor는 실행, Critic은 독립 검토를 맡는다는 책임 차이를 이해한다.
15 Supervisor 패턴: 평가와 제어의 분리 평가와 제어 결정을 분리해야 반복, 종료, HITL, 타임아웃이 중앙에서 통제된다는 점을 이해한다.
16 반복 제어, 이제는 Supervisor와 함께! 정책이 늘어날수록 중앙 제어자가 반복 횟수, 강제 종료, HITL 전환을 통제하는 구조가 유리함을 이해한다.
17 HITL을 단순 수동 개입이 아닌 Control Layer로 보기 HITL은 개입 조건, 중단, 검토, 의사결정, 개선 방향까지 포함하는 운영 정책임을 이해한다.
18 Supervisor 패턴 안에서 HITL 중앙 통제하기 HITL을 Supervisor의 정책 결정으로 두어 흐름과 개입이 한 곳에서 관리되어야 함을 이해한다.
19 HITL Trigger와 Human Review 노드 구현 감각 개입 조건, 사람의 선택지, Supervisor의 후속 결정이 State와 노드로 연결되는 방식을 이해한다.
20 AI Agent 워크플로우에 HITL '꽂기': '거절'을 '통제'로 전환하는 법 Critic의 부정 결과가 바로 반복으로 가지 않고 Human Review라는 통제 지점으로 전환될 수 있음을 이해한다.
21 LLM 디버깅의 핵심: Snapshot과 State 이력 멀티 Agent에서는 누가 언제 데이터를 바꿨는지 보려면 messages뿐 아니라 State 전체 이력이 필요함을 이해한다.
22 LangGraph Snapshot: 최신 상태와 과거 이력 들여다보기 LangGraph에서 최신 상태와 과거 이력을 구분해 읽는 방법을 이해한다.
23 Snapshot으로 실패 지점부터 재실행하기 Snapshot이 상태 검증뿐 아니라 특정 checkpoint 이후 재현과 branch 분석에 쓰인다는 점을 이해한다.
24 LangSmith로 LLM Agent 실행 관측: 정확하고 신뢰성 있는 데이터 수집의 기본 원칙 프로젝트와 환경 설정, 세션 재시작 주의, trace 저장 위치를 정확히 관리해야 관측 데이터가 쌓인다는 점을 이해한다.
25 Supervisor 패턴 실행 Trace와 Waterfall 읽기 Run Tree와 Waterfall을 통해 어느 노드와 LLM 단계에서 시간이 오래 걸렸는지 읽는 방법을 이해한다.
26 LLM 에이전트 관측: Snapshot과 Trace의 명확한 역할 상태 재현에는 Snapshot, 비용/성능/실행 흐름 분석에는 Trace가 더 적합하다는 차이를 이해한다.
27 제대로 된 AI Agent 평가하기 Agent는 여러 구성 요소가 결합된 시스템이므로 실행 단계, 비용, 지연, 목표 달성을 함께 평가해야 함을 이해한다.
28 Agent 출력, '느낌' 대신 '코드'로 평가하기 형식, 개수, 필드, 순번처럼 명확한 기준은 코드 평가 함수로 재현 가능하게 검증할 수 있음을 이해한다.
29 실행 Trace 시점에 Code Evaluator 붙이기: 비동기의 숨겨진 의미 실행과 평가는 분리되어 비동기로 진행되며, 평가 누락과 지연도 운영상 고려해야 함을 이해한다.
30 LLM-as-Judge: 재현 가능한 의미 기반 평가 설계 의미 기반 평가도 평가자 페르소나, 기준, 절차, 출력 형식, Provider secret이 있어야 재현 가능해진다는 점을 이해한다.
31 멀티 Agent 보고서 생성 시스템: Trace와 평가로 품질 확보하기 Trace와 평가가 멀티 Agent 반복 구조의 품질 검증 장치로 들어가는 흐름을 이해한다.
32 LLM 운영, 프롬프트 너머의 지속 가능한 개선 루프 운영 개선은 품질, 비용, 성능, 흐름을 측정하고 구조와 정책까지 반복 개선하는 루프임을 이해한다.
33 드리프트, 운영 리스크로 감지하고 대응하기 입력 분포, 입력-정답 관계, 성능 지표, 예측값 분포의 변화를 구분하고 모니터링해야 함을 이해한다.
34 파이썬 dict와 JSON, 헷갈리지 않고 Agent 시스템에 적용하기 dict는 Python 자료형, JSON은 교환용 문자열 포맷이며 loads/dumps, load/dump를 구분해야 함을 이해한다.
35 SQLite로 Agent 결과와 평가 데이터를 저장하기 영구 저장, 중복 방지, CRUD, 트랜잭션이 필요할 때 SQLite가 Agent 운영 보조 저장소가 될 수 있음을 이해한다.
36 Streamlit으로 Agent 결과 대시보드를 만들고 공개하기 Python 코드만으로 UI, 위젯, 차트, 필터, 캐시, 데이터 조회를 만들고 Agent 운영 결과를 보여줄 수 있음을 이해한다.