Copilot Studio 가이드: 에이전트 평가와 회귀 점검

Answer in brief

대표성 있는 Copilot Studio 테스트 세트를 구성하고 베이스라인을 기록한 뒤, 평가를 반복 실행하여 회귀 여부를 검토해야 합니다. 모든 릴리스 후보를 평가하는 절차는 Microsoft의 보편적 요구 사항이 아니라 권장 내부 통제로 구분하고, 책임 있는 AI 및 콘텐츠 안전성 검토는 별도로 수행해야 합니다. 제공된 두 공식 출처에는 선택 가능한 모델 ID가 명시되어 있지 않습니다.

Key facts at a glance

Product / model Current ID or version Use case Evidence
copilot-studio Official source does not specify a selectable model ID Confirm the current product surface Official source Official source

Failure modes and verification

Failure mode Verification action
Stale model or version reference Compare the model name and ID with the official source before release.
Unstructured or incomplete output Validate the response against the documented contract and a deterministic fixture.
Unverified factual claim Keep the claim qualified or remove the claim when the official source does not support it.

FAQ

Copilot Studio 기본 테스트 세트에는 무엇을 포함해야 합니까?

지원해야 하는 주요 시나리오뿐 아니라 금지되거나 범위를 벗어난 동작도 포함해야 합니다. 각 사례에는 프롬프트, 선택적인 예상 응답, 관찰 가능한 수용 기준, 적절한 평가 방법을 기록합니다.

테스트 채팅과 에이전트 평가 중 무엇을 사용해야 합니까?

두 방식을 함께 사용해야 합니다. 테스트 채팅은 대화형 세션을 직접 탐색하는 데 적합하고, 에이전트 평가는 여러 사례를 구조적으로 반복 실행하는 데 적합합니다. 두 방식의 역할은 에이전트 평가 개요에서 확인할 수 있습니다.

베이스라인 통과율은 어떻게 계산합니까?

각 실행에서는 통과한 사례 수를 전체 평가 사례 수로 나눕니다. 여러 번 실행한 뒤에는 실행별 통과율의 산술 평균을 반복 실행 평균 통과율로 계산하고, 변동성을 확인할 수 있도록 개별 실행 결과도 보존합니다.

80–90%의 통과율은 의무적인 릴리스 임계값입니까?

아닙니다. 에이전트 평가 체크리스트는 비즈니스 요구에 맞춰 조정할 현실적인 목표로 80–90%를 제시합니다. 이는 측정된 제품별 베이스라인도 아니고 보편적인 릴리스 기준도 아닙니다.

조직은 어떤 릴리스 판단 기준을 마련해야 합니까?

해결되지 않은 필수 핵심 회귀가 없고, 조직에서 승인한 평균 통과율 목표를 충족하며, 베이스라인 대비 설명되지 않은 중대한 하락이 없고, 별도의 안전성 검토가 완료되도록 내부 기준을 정할 수 있습니다. 이는 편집상 권고이며 Microsoft의 의무 사항은 아닙니다.

제공된 공식 출처에 선택 가능한 모델 ID가 명시되어 있습니까?

제공된 두 공식 출처에는 선택 가능한 모델 ID가 명시되어 있지 않습니다. 에이전트 버전, 베이스라인 날짜, 테스트 세트 버전, 언어, 사용자 프로필, 관련 구성 변경 사항처럼 확인할 수 있는 정보만 기록해야 합니다.

Sources and freshness

Extended guide

권장 접근 방식

Copilot Studio 에이전트 평가는 반복 가능한 품질 관리 절차로 운영합니다. 대표성 있는 테스트 사례를 설계하고, 수용 기준과 평가 방법을 정한 뒤, 날짜가 포함된 베이스라인을 수립합니다. 이후 같은 테스트 세트를 반복 실행하고 회귀 여부를 검토하여 변경 사항의 릴리스 여부를 결정합니다. Microsoft는 평가를 에이전트 설계부터 배포와 회귀 탐지까지 이어지는 반복 과정으로 설명합니다. 다만 모든 릴리스 후보에 이 절차를 적용하는 것은 내부 품질 관리를 강화하기 위한 편집상 권고이며, Microsoft가 제시한 보편적 요구 사항은 아닙니다.

제공된 두 공식 출처에는 선택 가능한 모델 ID가 명시되어 있지 않습니다. 따라서 평가 기록에는 확인할 수 있는 정보만 남겨야 합니다. 여기에는 에이전트 버전, 베이스라인 날짜, 테스트 세트 버전, 사용자 프로필, 언어와 함께 지침, 지식, 도구, 라우팅과 관련된 변경 사항이 포함됩니다.

1. 테스트 세트 설계

지원해야 하는 주요 시나리오와 금지되거나 범위를 벗어난 주요 동작마다 최소 한 개의 사례를 준비합니다. 각 사례에는 프롬프트, 선택적인 예상 응답, 명확한 수용 기준, 평가 방법을 기록합니다. 성공 여부는 관찰할 수 있는 조건으로 정의해야 합니다. 올바른 정보 사용, 핵심 과업 수행, 요구된 어조와 형식, 권한 준수, 필요한 인용, 적절한 담당자 연결, 거절 및 경계 동작 등이 이에 해당합니다. 처음에는 작은 기본 테스트 세트로 시작한 뒤, 필수 핵심 동작, 표현과 맥락 변화에 대한 대응력, 도구 호출과 라우팅 같은 아키텍처 동작, 예외 및 경계 사례로 범위를 넓힙니다.

2. 평가 방법 선택

평가 방법은 각 사례의 수용 기준에 맞춰 선택합니다. Copilot Studio는 실제 응답을 예상 응답 또는 정의된 품질 기준과 비교하고 사례별 점수를 부여할 수 있으며, 하나의 테스트 세트에 여러 평가 방법을 적용할 수 있습니다. 평가자가 문서화된 기준을 일관되게 적용한다면 수동 검토도 유효합니다. 대화 흐름을 직접 탐색할 때는 테스트 채팅을 사용하고, 여러 사례를 구조적으로 반복 실행할 때는 에이전트 평가를 사용합니다. 결과를 진단할 때는 응답뿐 아니라 대화 기록, 활동 맵, 응답 생성에 사용된 리소스도 확인합니다. 에이전트 평가는 정답성과 성능을 측정하지만, 책임 있는 AI 또는 콘텐츠 안전성 검토를 대신하지 않습니다.

3. 베이스라인 수립

기본 테스트 세트를 실행하고 모든 사례의 통과 또는 실패 여부를 기록합니다. 한 번의 실행에서 통과한 사례 수를 전체 평가 사례 수로 나누어 실행별 통과율을 계산하고, 에이전트 버전과 베이스라인 날짜도 보존합니다. 제공된 근거에는 실제로 측정된 제품별 베이스라인 결과가 없으므로 특정 수치를 관측 결과처럼 제시해서는 안 됩니다. Microsoft는 비즈니스 요구에 맞춰 80–90%의 평균 통과율을 현실적인 목표로 고려하도록 안내합니다. 이 범위는 Copilot Studio에서 측정된 결과나 모든 조직에 적용되는 공통 릴리스 기준이 아닙니다.

4. 일관된 조건으로 반복 실행

에이전트는 동일한 프롬프트에도 서로 다른 응답을 생성할 수 있으므로 같은 테스트 세트를 여러 번 실행합니다. 실행별 통과율을 모두 기록하고, 이를 산술 평균하여 반복 실행 평균 통과율을 계산합니다. 비교의 신뢰성을 높이려면 테스트 대상인 변수를 제외하고 사례, 수용 기준, 평가 방법, 사용자 프로필, 언어, 관련 구성을 동일하게 유지하는 것이 좋습니다. 이는 비교를 위한 편집상 권고이며 공식 문서의 의무 조건은 아닙니다. Copilot Studio 평가는 Power Platform REST APIs, 커넥터, 흐름, CI/CD 워크플로를 통해 자동으로 실행할 수도 있습니다.

5. 회귀 검토

릴리스 후보와 문서화된 베이스라인을 전체 통과율과 개별 사례 수준에서 비교합니다. 사람의 판단상 실패지만 평가에서는 통과한 위양성, 실제 실패로 확인된 사례, 증가한 결과 변동성, 필수 핵심 테스트 세트에서 발생한 모든 회귀를 조사합니다. 모호한 프롬프트, 잘못된 예상 응답, 불명확한 수용 기준은 테스트 사례 문제로 분류합니다. 지침, 지식, 도구, 라우팅, 인용 또는 가드레일의 결함은 에이전트 설계 문제로 분류합니다. 원인이 있는 계층을 수정한 뒤 관련 테스트 세트를 다시 실행합니다. 전체 평가 세트 실행을 권장하는 계기로는 모델 변경, 주요 지식 업데이트, 새로운 도구 또는 커넥터 통합, 프로덕션 사고가 있습니다.

조직별 릴리스 판단 기준

실무적인 내부 기준은 다음과 같이 정할 수 있습니다. 해결되지 않은 필수 핵심 회귀가 없고, 반복 실행 평균 통과율이 조직에서 승인한 목표를 충족하며, 베이스라인 대비 중대한 하락이 설명되지 않은 채 남아 있지 않고, 별도의 안전성 검토가 완료된 경우에만 릴리스합니다. 예외가 있다면 사유, 책임자, 승인 근거를 기록합니다. 이는 제안하는 내부 관리 기준이며 Microsoft가 의무화한 임계값은 아닙니다.

자세한 내용은 에이전트 평가 개요에이전트 평가 체크리스트를 참조하십시오.

모델 제공 범위 안내: 공식 출처는 선택 가능한 모델 ID를 지정하지 않습니다.

근거와 최신성

근거 수준: 공식 문서 검증

AI-assisted editorial content; verify current product details against the linked official sources.

마지막 검증:

주요 출처

다른 도구 둘러보기

Mistral API 가이드: Agents·Conversations와 상태 기반 handoff가이드Claude API 가이드: 멀티도구 워크플로우의 프로그래밍 방식 도구 호출가이드Groq Batch API 가이드: 비동기 JSONL 작업과 결과 회수가이드GitHub Copilot 가이드: 커스텀 에이전트와 서브에이전트 오케스트레이션가이드Gemini API 가이드: URL 컨텍스트와 검색 그라운딩가이드OpenAI Responses API 가이드: 백그라운드 실행과 컨텍스트 관리가이드GitHub Copilot 가이드: 권한·감사·복구를 위한 Hooks가이드Claude Agent SDK 가이드: 동적 멀티에이전트 워크플로우가이드Microsoft Agent Framework 가이드: HITL 요청과 checkpoint 재개가이드Claude Code 가이드: 훅 수명주기 자동화와 실행 경계가이드Cloudflare Agents 가이드: 내구성 워크플로우와 사람 승인가이드Timeline Studio 가이드: 브라우저에서 실행하는 로컬 우선 AI 영상 편집가이드NVIDIA NeMo Agent Toolkit 가이드: 평가·profiling과 tracing가이드Amazon Bedrock AgentCore Memory 가이드: 전략·namespace와 검색가이드Gemini API 가이드: File Search 저장소와 RAG 경계가이드Copilot Studio 가이드: 가드레일 기반 자율 에이전트 운영가이드Claude Code 가이드: 플러그인 패키징·테스트와 배포가이드LangGraph 가이드: persistence·checkpoint와 내구성 있는 에이전트 복구가이드Vercel AI SDK 가이드: ToolLoopAgent·루프 제어와 승인가이드OpenAI Agents SDK 가이드: tracing·span과 민감 데이터 제어가이드