Chat
사람이 질문하고 AI가 답합니다. 품질은 질문과 제공한 자료의 범위에 크게 좌우됩니다.
질문하는 AI에서 함께 일하는 AI로
클릭하거나 잠시 기다리면 시작합니다기술 이름은 바뀌어도 진화의 방향은 일관됩니다. AI의 출력이 문장에서 코드로, 코드에서 행동으로, 행동에서 협업으로 확장되고 있습니다.
사람이 질문하고 AI가 답합니다. 품질은 질문과 제공한 자료의 범위에 크게 좌우됩니다.
자연어가 코드·웹앱·시뮬레이터로 변환됩니다. 사람은 “무엇을 만들지”에 더 집중합니다.
AI가 계획하고 파일·터미널·브라우저·앱을 사용해 여러 단계를 수행합니다.
기억·스킬·도구·전문 에이전트·평가·승인 게이트를 하나의 운영체계로 엮습니다.
어떤 목표를 주고, 어디까지 권한을 주며, 무엇을 기록하고, 언제 사람이 개입해야 신뢰할 수 있는 결과가 나오는가?
현재 시스템은 넓은 과제를 수행하지만 능력은 여전히 들쭉날쭉합니다. 따라서 “AGI 도착”을 선언하기보다 범용성·자율성·신뢰성·적응성·안전성이 각각 어디까지 왔는지 분리해 봐야 합니다.
요약·번역·질의응답. 행동 없이 텍스트를 생성합니다.
문제를 나누고 코드와 분석 결과를 만듭니다.
검색·파일·셸·브라우저·앱을 통해 현실에 작용합니다.
상태를 유지하고 스킬을 재사용하며 여러 주체와 협업합니다.
새 환경에서도 안정적으로 학습·행동·자기수정하는 단계는 아직 열린 문제입니다.
2026 국제 AI 안전 보고서는 최첨단 시스템이 어려운 과제에서 뛰어나면서도 단순한 공간 추론·기본 오류 복구에서 실패하는 “jagged capability”를 강조합니다. 장기 과제의 성공률과 실제 현장의 안전한 자율성도 구분해야 합니다.
같은 모델도 컨텍스트와 권한, 도구, 평가 구조에 따라 전혀 다른 결과를 냅니다. 에이전틱 시스템은 아래 다섯 층을 함께 설계해야 합니다.
책임자, 승인 게이트, 감사 추적, 법·보안 정책, 중단 조건
TRUST계획, 위임, 멀티에이전트, 상태 관리, 재시도와 종료 조건
CONTROL반복 가능한 업무 절차, 예제, 스크립트, 성공 기준과 회귀 평가
REPEAT검색·파일·컴퓨터 사용·MCP·A2A·사내 시스템 연결
ACT추론 모델, 도메인 데이터, 메모리, 역할과 목표
THINK모델 성능표는 빠르게 낡지만, 에이전트가 실제 업무 시스템으로 들어가는 기반 기술은 뚜렷하게 수렴하고 있습니다.
지침·참고자료·스크립트를 묶어 반복 업무를 버전 관리합니다. 잘 만든 개인 프롬프트를 조직의 검증 가능한 자산으로 바꿉니다.
OpenAI 공식 문서 ↗최신 규격은 stateless core, header routing, cacheable list, 권한 강화와 확장 구조를 도입해 기업형 연결의 확장성과 통제를 개선했습니다.
MCP 공식 릴리스 ↗서로 다른 프레임워크·기업의 에이전트가 능력을 발견하고, 대화하고, 일을 위임하는 안정 규격이 등장했습니다.
A2A 공식 발표 ↗API가 없는 소프트웨어도 화면을 보고 조작할 수 있습니다. 범용성은 커졌지만 UI 오인식과 과도한 권한 위험도 함께 커집니다.
OpenAI 공식 문서 ↗대화 한 번이 아니라 최근 작업과 선호, 프로젝트 맥락을 이어받습니다. 기억의 출처·수명·삭제권 설계가 중요해졌습니다.
OpenAI 공식 문서 ↗에이전트의 답만 평가하지 않고 어떤 도구를 어떤 순서로 사용했는지 trace와 artifact까지 회귀 테스트합니다.
OpenAI Evals 가이드 ↗개인 사용의 확산과 조직 시스템의 성숙은 다른 속도로 움직입니다. 지금의 기회는 모델을 더 많이 사는 데 있지 않고, 소수의 고급 사용 패턴을 안전한 팀 표준으로 확장하는 데 있습니다.
생성형 AI는 PC·인터넷보다 빠르게 확산했습니다.
Stanford AI Index 2026 ↗그러나 기능별 에이전트 배치는 대체로 한 자릿수입니다.
Stanford Economy ↗개인 역량과 조직 준비가 모두 높은 사용자는 약 5명 중 1명입니다.
Microsoft WTI 2026 ↗Anthropic 조사에서 해당 제품 사용자의 평균 사용 시간입니다. 표본 편향을 고려해야 합니다.
Anthropic 연구 ↗METR는 인간 전문가가 오래 걸리는 소프트웨어 과제의 난도와 에이전트 성공 확률을 연결합니다. 이는 무감독 운영 시간이나 99% 신뢰성을 뜻하지 않으며, 실제 업무는 더 많은 맥락·예외·보안 조건을 가집니다.
예: OLED/TFT 신뢰성 이상을 분석하고 기술 보고서를 만드는 업무. 모든 권한을 한 에이전트에 주는 대신 역할과 근거를 분리하면 오류 원인을 추적하고 재실행하기 쉬워집니다.
문제 정의, 데이터 사전, 단위, 보안등급과 완료 조건을 확인합니다.
HUMAN · 범위 승인결측·이상치·split을 진단하고 재현 가능한 분석 테이블을 만듭니다.
열화 메커니즘, 회로 역할, 문헌과 특허 근거를 연결합니다.
후보 모델을 비교하고 불확실성·외삽 위험·실험 계획을 제시합니다.
HUMAN · 모델 승인수치·인용·반례·보안 누출을 점검하고 보고서와 시뮬레이터를 패키징합니다.
HUMAN · 배포 승인에이전트 수, 자율성, 도구 권한, 사람의 검토 비율을 움직여 속도·품질·위험·비용의 상충관계를 확인하세요. 숫자는 개념 교육용 상대지수입니다.
※ 교육용 휴리스틱입니다. 실제 운영 전에는 조직 데이터로 비용·정확도·사고율을 측정해 보정해야 합니다.
에이전트는 읽는 AI가 아니라 행동하는 소프트웨어입니다. 프롬프트 인젝션, 과도한 권한, 도구 공급망, 데이터 유출과 책임 추적 문제를 일반 앱 보안보다 더 엄격하게 다뤄야 합니다.
기본은 read-only. 쓰기·전송·결제·삭제는 작업별로 좁게 열고 매번 승인합니다.
웹·메일·문서의 텍스트를 명령으로 신뢰하지 않고 외부 데이터로 표시·필터링합니다.
검증된 MCP·스킬만 등록하고 버전·서명·소유자·권한을 기록합니다.
비가역 행동, 고영향 판단, 대외 배포 직전에 사람의 명시적 승인을 요구합니다.
프롬프트뿐 아니라 호출 도구, 입력, 결과, 승인자, 실패·재시도 경로를 남깁니다.
비용·반복·시간·오류 한도를 정하고 조건을 넘으면 즉시 중단하도록 만듭니다.
한 달의 목표는 “전사 AGI”가 아니라, 가치가 분명하고 위험을 통제할 수 있는 업무 하나를 반복 가능한 스킬과 평가 세트로 전환하는 것입니다.
“AI를 썼다”가 아니라 동일한 입력에 대해 더 빠르고, 더 정확하고, 더 추적 가능하며, 문제가 생겼을 때 즉시 멈출 수 있는가?
AI의 다음 단계는 더 똑똑한 채팅창 하나가 아닙니다. 사람의 목표와 책임 아래 기억·스킬·도구·에이전트·검증이 함께 움직이는 새로운 업무 운영체계입니다.