AI SEMINAR · SESSION 04

AGI로 가는 길목
Agentic Work

질문하는 AI에서 함께 일하는 AI로

클릭하거나 잠시 기다리면 시작합니다
2026.08.18 · 외부 세미나 최신판

AGI로 가는 길목,
Agentic Work

대화형 AI는 코드를 만들고, 도구를 쓰고, 기억하고, 다른 에이전트에게 일을 위임하기 시작했습니다. 이제 경쟁력은 “어떤 모델을 쓰는가”보다 “AI가 안전하게 끝까지 일하는 구조를 어떻게 설계하는가”에서 갈립니다.

AGENTIC
WORK
CONTEXT기억
WORKFLOW스킬
ACTION도구
CONNECTMCP
COLLABORATEA2A
TRUST평가·승인
01 · From chat to action

세 번의 세미나가
만든 하나의 흐름

기술 이름은 바뀌어도 진화의 방향은 일관됩니다. AI의 출력이 문장에서 코드로, 코드에서 행동으로, 행동에서 협업으로 확장되고 있습니다.

01

Chat

사람이 질문하고 AI가 답합니다. 품질은 질문과 제공한 자료의 범위에 크게 좌우됩니다.

02

Vibe Coding

자연어가 코드·웹앱·시뮬레이터로 변환됩니다. 사람은 “무엇을 만들지”에 더 집중합니다.

03

Agent

AI가 계획하고 파일·터미널·브라우저·앱을 사용해 여러 단계를 수행합니다.

04

Agentic Work

기억·스킬·도구·전문 에이전트·평가·승인 게이트를 하나의 운영체계로 엮습니다.

4차의 질문은 “AI가 무엇을 아는가?”가 아닙니다.

어떤 목표를 주고, 어디까지 권한을 주며, 무엇을 기록하고, 언제 사람이 개입해야 신뢰할 수 있는 결과가 나오는가?

02 · AGI without hype

AGI는 한 번의 점프가 아니라
능력 묶음의 축적

현재 시스템은 넓은 과제를 수행하지만 능력은 여전히 들쭉날쭉합니다. 따라서 “AGI 도착”을 선언하기보다 범용성·자율성·신뢰성·적응성·안전성이 각각 어디까지 왔는지 분리해 봐야 합니다.

LEVEL 1

언어 생성

요약·번역·질의응답. 행동 없이 텍스트를 생성합니다.

LEVEL 2

추론·코딩

문제를 나누고 코드와 분석 결과를 만듭니다.

LEVEL 3

도구 사용

검색·파일·셸·브라우저·앱을 통해 현실에 작용합니다.

LEVEL 4 · NOW

지속형 에이전트

상태를 유지하고 스킬을 재사용하며 여러 주체와 협업합니다.

LEVEL 5 · OPEN

신뢰 가능한 범용성

새 환경에서도 안정적으로 학습·행동·자기수정하는 단계는 아직 열린 문제입니다.

!
능력 향상과 AGI는 같은 말이 아닙니다.

2026 국제 AI 안전 보고서는 최첨단 시스템이 어려운 과제에서 뛰어나면서도 단순한 공간 추론·기본 오류 복구에서 실패하는 “jagged capability”를 강조합니다. 장기 과제의 성공률과 실제 현장의 안전한 자율성도 구분해야 합니다.

03 · The agentic stack

모델보다 중요한 것은
모델을 둘러싼 시스템

같은 모델도 컨텍스트와 권한, 도구, 평가 구조에 따라 전혀 다른 결과를 냅니다. 에이전틱 시스템은 아래 다섯 층을 함께 설계해야 합니다.

5 · Governance

책임자, 승인 게이트, 감사 추적, 법·보안 정책, 중단 조건

TRUST
4 · Orchestration

계획, 위임, 멀티에이전트, 상태 관리, 재시도와 종료 조건

CONTROL
3 · Skills & Evals

반복 가능한 업무 절차, 예제, 스크립트, 성공 기준과 회귀 평가

REPEAT
2 · Tools & Protocols

검색·파일·컴퓨터 사용·MCP·A2A·사내 시스템 연결

ACT
1 · Model & Context

추론 모델, 도메인 데이터, 메모리, 역할과 목표

THINK
04 · What changed in 2026

최근 기술의 핵심은
연결·재사용·협업

모델 성능표는 빠르게 낡지만, 에이전트가 실제 업무 시스템으로 들어가는 기반 기술은 뚜렷하게 수렴하고 있습니다.

WORKFLOW

Skills

지침·참고자료·스크립트를 묶어 반복 업무를 버전 관리합니다. 잘 만든 개인 프롬프트를 조직의 검증 가능한 자산으로 바꿉니다.

OpenAI 공식 문서 ↗
TOOLS

MCP 2026-07-28

최신 규격은 stateless core, header routing, cacheable list, 권한 강화와 확장 구조를 도입해 기업형 연결의 확장성과 통제를 개선했습니다.

MCP 공식 릴리스 ↗
COLLABORATION

A2A v1.0

서로 다른 프레임워크·기업의 에이전트가 능력을 발견하고, 대화하고, 일을 위임하는 안정 규격이 등장했습니다.

A2A 공식 발표 ↗
INTERFACE

Computer Use

API가 없는 소프트웨어도 화면을 보고 조작할 수 있습니다. 범용성은 커졌지만 UI 오인식과 과도한 권한 위험도 함께 커집니다.

OpenAI 공식 문서 ↗
CONTEXT

Memory & History

대화 한 번이 아니라 최근 작업과 선호, 프로젝트 맥락을 이어받습니다. 기억의 출처·수명·삭제권 설계가 중요해졌습니다.

OpenAI 공식 문서 ↗
QUALITY

Evals & Tracing

에이전트의 답만 평가하지 않고 어떤 도구를 어떤 순서로 사용했는지 trace와 artifact까지 회귀 테스트합니다.

OpenAI Evals 가이드 ↗

MCP

Agent ↔ Tools & Data
  • DB·파일·검색·사내 서비스 연결
  • 도구 목록과 호출 규격 표준화
  • 인증·권한·입력 검증이 핵심
+

A2A

Agent ↔ Agent
  • 전문 에이전트의 발견과 위임
  • 장기 작업의 상태·결과 교환
  • 서로 다른 공급자 간 상호운용
05 · Evidence, not excitement

사용은 보편화됐지만
에이전트 운영은 초기

개인 사용의 확산과 조직 시스템의 성숙은 다른 속도로 움직입니다. 지금의 기회는 모델을 더 많이 사는 데 있지 않고, 소수의 고급 사용 패턴을 안전한 팀 표준으로 확장하는 데 있습니다.

88%

조직 AI 도입

그러나 기능별 에이전트 배치는 대체로 한 자릿수입니다.

Stanford Economy ↗
19%

Frontier 사용자

개인 역량과 조직 준비가 모두 높은 사용자는 약 5명 중 1명입니다.

Microsoft WTI 2026 ↗
20h

주당 코딩 에이전트 사용

Anthropic 조사에서 해당 제품 사용자의 평균 사용 시간입니다. 표본 편향을 고려해야 합니다.

Anthropic 연구 ↗
시간 지평(time horizon)을 자율 운전 시간처럼 읽으면 안 됩니다.

METR는 인간 전문가가 오래 걸리는 소프트웨어 과제의 난도와 에이전트 성공 확률을 연결합니다. 이는 무감독 운영 시간이나 99% 신뢰성을 뜻하지 않으며, 실제 업무는 더 많은 맥락·예외·보안 조건을 가집니다.

06 · Manufacturing R&D case

한 명의 만능 AI보다
역할이 분명한 팀

예: OLED/TFT 신뢰성 이상을 분석하고 기술 보고서를 만드는 업무. 모든 권한을 한 에이전트에 주는 대신 역할과 근거를 분리하면 오류 원인을 추적하고 재실행하기 쉬워집니다.

01

Intake Agent

문제 정의, 데이터 사전, 단위, 보안등급과 완료 조건을 확인합니다.

HUMAN · 범위 승인
02

Data Agent

결측·이상치·split을 진단하고 재현 가능한 분석 테이블을 만듭니다.

03

Physics Agent

열화 메커니즘, 회로 역할, 문헌과 특허 근거를 연결합니다.

04

Model Agent

후보 모델을 비교하고 불확실성·외삽 위험·실험 계획을 제시합니다.

HUMAN · 모델 승인
05

Reviewer Agent

수치·인용·반례·보안 누출을 점검하고 보고서와 시뮬레이터를 패키징합니다.

HUMAN · 배포 승인
사람의 역할은 줄어드는 것이 아니라 위로 이동합니다. 데이터 의미 확정 → 가설 선택 → 위험 승인 → 대외 메시지 책임
07 · Autonomy design lab

자율성은 높일수록
좋은 값이 아닙니다

에이전트 수, 자율성, 도구 권한, 사람의 검토 비율을 움직여 속도·품질·위험·비용의 상충관계를 확인하세요. 숫자는 개념 교육용 상대지수입니다.

55
계획·재시도·의사결정을 스스로 수행하는 정도
40
읽기 전용에서 외부 시스템 쓰기·실행까지의 범위
70
중간 산출물과 고위험 행동을 사람이 확인하는 정도
4
분업은 품질을 높이지만 조정 비용과 토큰도 증가
작업 속도0
예상 품질0
운영 위험0
상대 비용0
권장 운영

※ 교육용 휴리스틱입니다. 실제 운영 전에는 조직 데이터로 비용·정확도·사고율을 측정해 보정해야 합니다.

08 · Security by design

에이전트의 능력보다 먼저
권한과 책임을 설계하라

에이전트는 읽는 AI가 아니라 행동하는 소프트웨어입니다. 프롬프트 인젝션, 과도한 권한, 도구 공급망, 데이터 유출과 책임 추적 문제를 일반 앱 보안보다 더 엄격하게 다뤄야 합니다.

CONTROL 01

최소 권한

기본은 read-only. 쓰기·전송·결제·삭제는 작업별로 좁게 열고 매번 승인합니다.

CONTROL 02

입력 격리

웹·메일·문서의 텍스트를 명령으로 신뢰하지 않고 외부 데이터로 표시·필터링합니다.

CONTROL 03

도구 allowlist

검증된 MCP·스킬만 등록하고 버전·서명·소유자·권한을 기록합니다.

CONTROL 04

승인 게이트

비가역 행동, 고영향 판단, 대외 배포 직전에 사람의 명시적 승인을 요구합니다.

CONTROL 05

Trace & Evals

프롬프트뿐 아니라 호출 도구, 입력, 결과, 승인자, 실패·재시도 경로를 남깁니다.

CONTROL 06

Kill switch

비용·반복·시간·오류 한도를 정하고 조건을 넘으면 즉시 중단하도록 만듭니다.

대한민국 AI 기본법

국가법령정보센터 기준 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」은 2026년 7월 21일 시행 상태입니다. 고영향 AI, 투명성, 안전·신뢰 의무를 서비스 설계 초기에 검토해야 합니다. 공식 법령 ↗

KISA 2026 실무 지침

KISA는 2026년 7월 AI 보안 위협 대응 매뉴얼과 레드티밍 가이드를 공개했습니다. 데이터·모델·에이전트·공급망·고성능 모델을 함께 점검하는 국내 실무 기준으로 활용할 수 있습니다. 공식 안내 ↗

09 · 30-day action plan

거대한 플랫폼보다
검증된 한 업무부터

한 달의 목표는 “전사 AGI”가 아니라, 가치가 분명하고 위험을 통제할 수 있는 업무 하나를 반복 가능한 스킬과 평가 세트로 전환하는 것입니다.

WEEK 01

업무 선택

  • 반복 빈도·가치·위험 점수화
  • 현재 시간·오류율 baseline
  • 데이터 오너와 승인자 지정
WEEK 02

단일 에이전트

  • read-only 도구부터 연결
  • 완료 조건·중단 조건 정의
  • 대표 20건 평가 세트 작성
WEEK 03

스킬·분업

  • 반복 절차를 Skill로 고정
  • 병렬 이득이 있는 역할만 분리
  • trace와 비용 측정
WEEK 04

통제된 배포

  • 사람 승인 게이트 적용
  • 레드팀·오류 회귀 테스트
  • 효과·사고·비용 리뷰 후 확장
성공 기준

“AI를 썼다”가 아니라 동일한 입력에 대해 더 빠르고, 더 정확하고, 더 추적 가능하며, 문제가 생겼을 때 즉시 멈출 수 있는가?

THE FOURTH MESSAGE

AGI를 기다리지 말고
신뢰 가능한 협업 구조를 설계하라

AI의 다음 단계는 더 똑똑한 채팅창 하나가 아닙니다. 사람의 목표와 책임 아래 기억·스킬·도구·에이전트·검증이 함께 움직이는 새로운 업무 운영체계입니다.