A to Z를 함께합니다
믿을 수 있는 AI를 위해 처음부터 끝까지, 원하시는 방법으로 도와드립니다

자동화 플랫폼: Datumo Eval
다투모 이밸
직접 구상한 절차를 자동화 툴로 검증·감독하고 싶은 분께 적합합니다
자동화 플랫폼: Datumo Eval
다투모 이밸
직접 구상한 절차를 자동화 툴로 검증·감독하고 싶은 분께 적합합니다
주요 기능
AI 에이전트를 활용한 평가용 데이터 자동 생성
AI 에이전트를 활용한 평가용 데이터 자동 생성

업로드된 고객의 정책 및 상품 문서를 통해 더욱 정교하고 현실적인 질문 데이터를 생성합니다. 신뢰성 및 정보 정확성 등 LLM 검증 분야별로 고품질 질문을 대량 제작하여, 효과적인 평가를 제공합니다.

현장 중심의 실질적 데이터 생성
현장 중심의 실질적 데이터 생성

실제 기업의 비즈니스 환경을 반영하여, 실제 사용자 환경에서 발생할 수 있는 다양한 시나리오에 기반한 평가용 질문 데이터를 생성합니다.

맞춤형 지표 및 기준에 따른 철저한 평가
맞춤형 지표 및 기준에 따른 철저한 평가

기본으로 제공되는 지표는 물론, 직접 세밀하게 설정한 지표와 기준에 따라 다양한 평가가 가능합니다. 모든 답변에 대한 평가 결과 사유를 제공합니다.

대시보드를 통한 검증 결과 시각화 및 분석
대시보드를 통한 검증 결과 시각화 및 분석

지표별 답변 점수 분포, 모델별 성능 차이 등 다양한 결과를 한눈에 볼 수 있는 대시보드를 제공합니다.

AI 레드티밍 자동화 및 시각화
AI 레드티밍 자동화 및 시각화

기다릴 필요 없이, 언제든 모델의 목적과 특성에 맞춘 AI 레드티밍을 자동으로 실시할 수 있습니다. 결과 또한 대시보드로 시각화하여 취약점을 빠르게 파악할 수 있습니다.

Basic
- 단일 청크 기반 싱글턴 평가용 질문 생성
Safety 평가 데이터
-
당사 자체 Safety 평가 데이터 총 1천개 제공
(편향성, 혐오성, 위법성)
싱글턴 자동 평가
-
Text Decomposition 기반 RAG Quality 평가
(w/o 기대 답변) - Safety 평가 (편향성, 혐오성, 위법성)
- Custom 평가 프롬프트 작성(Likert Scale, 가중치합, AND/OR 연산 평가 지원)
평가 결과 대시보드
- 모델·지표별 평가 점수 비교 및 세부 결과 확인
- 메타데이터에 따른 성능 히트맵 및 필터링
Standard
Basic 모든 기능
- 단일 청크 기반 싱글턴 평가용 질문 생성
- Safety 평가 데이터
- 싱글턴 자동 평가
- 평가 결과 대시보드
다중 청크 기반 싱글턴 평가용 질문 생성
* 개발 중
- 데이터 생성용 연관 청크 선별
- 다중 청크 기반 평가용 질문 생성
싱글턴 자동 평가
-
Text Decomposition 기반 RAG Quality
평가 (w/ 기대 답변)
Add-on
Red Teaming
Human 레드티밍
- 레드티밍 전략 가이드라인 제공
- Human 레드티밍 작업 운영 기능
Safety 자동 레드티밍
- Seed 데이터 업로드
- Seed 데이터 기반 공격 프롬프트 자동 생성
- 레드티밍 성공 여부 자동 평가
- 자동 평가 기반 공격 프롬프트 자동 재생성
Basic
- 단일 청크 기반 싱글턴 평가용 질문 생성
Safety 평가 데이터
- 당사 자체 Safety 평가 데이터 총 1천개 제공
싱글턴 자동 평가
-
Text Decomposition 기반 RAG Quality 평가
(w/o 기대 답변) - 안전성 평가
- 맞춤형 평가 프롬프트 작성
평가 결과 대시보드
- 모델·지표별 평가 점수 비교 및 세부 결과 확인
- 메타데이터에 따른 성능 히트맵 및 필터링
Standard
Basic 모든 기능
- 단일 청크 기반 싱글턴 평가용 질문 생성
- Safety 평가 데이터
- 싱글턴 자동 평가
- 평가 결과 대시보드
다중 청크 기반 싱글턴 평가용 질문 생성
* 개발 중
- 데이터 생성용 연관 청크 선별
- 다중 청크 기반 평가용 질문 생성
싱글턴 자동 평가
-
Text Decomposition 기반 RAG Quality
평가 (w/ 기대 답변)
Add-on
Red Teaming
Human 레드티밍
- 레드티밍 전략 가이드라인 제공
- Human 레드티밍 작업 운영 기능
Safety 자동 레드티밍
- Seed 데이터 업로드
- 공격 프롬프트 자동 생성
- 레드티밍 성공 여부 자동 평가
- 공격 프롬프트 자동 재생성
문의 전 자주 묻는 질문
AI 신뢰성 평가 대상부터 결과 제공 방식까지
A.
LLM 평가는 AI 모델 또는 AI 서비스가 의도한 기준에 맞게 동작하는지 확인하는 과정입니다.
고객의 목적에 따라
LLM 자체 성능 평가, RAG 서비스 평가, AI 서비스 전체 검증으로
나누어 진행하며, 서비스 유형과 주요 리스크를 고려해 평가 범위와 시나리오를 설계합니다.
상세 내용 보기
① LLM 자체 평가
LLM 자체 평가는 특정 서비스 응용단을 제외하고,
모델이 보유한
언어 이해, 생성, 추론, 안전성 등 기본 역량을 종합적으로 측정하는 과정입니다.
표준화된 벤치마크와 평가 지표를 활용해 모델 자체의 지능과 안전성 범위를 검증할 수 있습니다.
- 지식 및 추론 평가:
텍스트 요약, 질의응답, 논리적 추론의 정밀도 등 - 안전성 및 윤리성 평가:
유해성, 편향성, 탈옥 방어율, 정보 유출 리스크 등 - 표준 벤치마크 평가:
MMLU, GSM8K, ARC, HumanEval 등 글로벌 벤치마크 기반 지표
이를 통해 도입 후보 모델 간 상대적인 성능을 비교하거나,
Fine-tuning 전후의 역량 변화를 측정하고,
기초 모델의 정량적인 안전성 수준을 확인할 수 있습니다.
② RAG 서비스 평가
RAG(Retrieval-Augmented Generation) 평가는 모델 자체의 지식뿐 아니라
외부 지식 베이스(문서, DB, 웹 검색 등)를 참조해 답변을 생성하는
RAG 시스템 전체 파이프라인의 정확성과 신뢰성을 검증하는 과정입니다.
검색(Retrieval)과 생성(Generation) 영역을 분리해
각 단계에서 발생할 수 있는 오류를 정밀하게 확인합니다.
- 검색 관련성:
사용자 질문에 적절한 Context를 찾아오는지 - 답변 근거성:
참조 문맥을 바탕으로 환각 없이 답변하는지 - 답변 관련성:
생성된 답변이 사용자의 질문과 의도에 부합하는지
이를 통해 환각을 줄이고 내부 지식 기반 질의응답의 정확도를 확인하며,
검색 엔진과 LLM 결합부에서 발생하는 병목 구간을 파악할 수 있습니다.
③ AI 서비스 전체 검증
AI 서비스 검증은 모델 단위의 성능 평가뿐 아니라,
실제 비즈니스 시나리오에서 AI 서비스 전체가 고객 요구사항과 비즈니스 목적을 충족하는지
확인하는 과정입니다.
- 도메인 특화 정확도:
실제 업무 시나리오에서 사용자의 요청을 제대로 처리하는지 - Edge Case 테스트:
이상치 입력, 악의적 공격, 모호한 질문 등에 대응하는지 - 사용자 관점 품질:
응답 속도, 답변 스타일의 일관성, 업무 효율성 등 - 모니터링 및 성능 유지:
출시 후 성능 저하를 감지하고 개선할 수 있는 검증 Loop
이를 통해 비즈니스 리스크를 줄이고,
서비스 상용화 단계에서 활용할 수 있는 객관적인 품질 기준을 마련할 수 있습니다.
DATUMO Eval은 어떻게 진행되나요?
고객사의 서비스 구조와 주요 리스크를 먼저 파악한 뒤
그에 맞는 평가 시나리오와 지표를 설계합니다.
평가 지표와 시나리오 설계가 어려운 경우에는 별도로 지원할 수 있으며,
실제 평가 실행과 결과 리포트 산출은
DATUMO Platform을 통해 진행합니다.
다만 평가 결과를 바탕으로
모델 자체를 직접 개선하는 작업은 제공 범위에 포함되지 않습니다.
셀렉트스타는 평가 솔루션 제공과 평가 환경 구축,
평가 실행과 결과 분석을 지원합니다.
A.
AI 서비스는 기존 소프트웨어와 달리 동일한 입력에도 결과가 달라질 수 있으며,
환각, 편향성, 유해 응답, 개인정보 노출, 보안 취약점 등 다양한 리스크가 발생할 수 있습니다.
AI 신뢰성 평가는 이러한 불확실성과 위험을 사전에 확인하고,
서비스 출시와 개선을 위한 객관적인 판단 근거를 마련하는 과정
입니다.
상세 내용 보기
① 출시 전 리스크 점검
AI 서비스를 실제 사용자에게 제공하기 전에
운영 환경에서 발생할 수 있는 시스템 및 비즈니스 리스크를 확인합니다.
출시 이후 문제가 발생한 뒤 대응하기보다,
서비스 설계가 어느 정도 구체화된 단계부터 평가를 시작해 개선할 시간을 확보하는 것이 중요합니다.
- 서비스 품질 및 환각 점검:
AI가 사실과 다른 내용을 답하거나 문맥과 맞지 않는 답변을 생성하는지 평가합니다. - 보안 및 적대적 공격 점검:
프롬프트 인젝션, 탈옥, 민감정보 유출 등 악의적인 사용 시나리오에서
취약점이 발생하는지 확인합니다. - 브랜드 및 비즈니스 리스크 점검:
유해 콘텐츠, 편향된 발언, 잘못된 비즈니스 정보 등으로 인해
발생할 수 있는 서비스 신뢰도 저하와 비즈니스 리스크를 점검합니다.
② 규제 및 거버넌스 대응
AI 서비스의 위험을 어떤 항목과 기준으로 평가했는지 기록하고 정리하면
조직의 AI 거버넌스와 위험 관리 과정에서 활용할 수 있는 근거를 마련할 수 있습니다.
- 위험 기반 평가:
서비스에서 중요하게 관리해야 하는 위험 요소를 정의하고
이에 맞는 평가 기준과 데이터를 마련할 수 있습니다. - 평가 결과 기록:
평가 항목과 결과를 정량·정성 데이터로 관리해
내부 검토와 위험 관리에 활용할 수 있습니다. - 산업별 요구사항 검토:
금융, 공공 등 산업과 서비스 특성에 따라 필요한 평가 범위를
프로젝트 협의 과정에서 구체화할 수 있습니다.
※ 적용되는 법령·규제·표준과 세부 요구사항은 서비스 유형,
산업 및 프로젝트 범위에 따라 달라질 수 있으며,
구체적인 대응 범위는 프로젝트 협의 과정에서 확인합니다.
③ 내부 승인 및 의사결정
서비스 출시를 앞두면 경영진, 보안, 리스크 관리 등 여러 이해관계자가
AI 서비스를 실제 사용자에게 제공해도 되는지 판단해야 합니다.
이때 감이나 주관적인 판단이 아니라
어떤 항목을 어떤 기준으로 검증했는지 보여주는 평가 결과
가 의사결정의 근거가 될 수 있습니다.
- 데이터 기반 의사결정:
정확성, 근거성, 안전성 등 서비스에 필요한 지표를 활용해
현재 품질 수준을 확인할 수 있습니다. - 한계와 리스크 가시화:
현재 AI 서비스의 성능과 한계를 문서화해
추가 개선이 필요한 영역을 파악할 수 있습니다. - 출시 기준 마련:
서비스에 필요한 평가 기준과 목표 수준을 정하고
출시 여부를 판단하는 내부 기준으로 활용할 수 있습니다.
A.
LLM 기반 챗봇, RAG 서비스, AI Agent, 생성형 AI 서비스 등
다양한 AI 모델과 서비스를 평가할 수 있습니다.
온프레미스 sLM부터 외부 LLM API 기반 서비스까지 운영 방식과 서비스 구조에 맞춰 평가 범위와 시나리오를 설계합니다.
상세 내용 보기
평가 지원 모델 범위
- 상용 API 기반 모델
- 국내·외 오픈소스 모델
- 멀티모달 및 도메인 특화 모델
단일 LLM API부터 DB·외부 API와 연결된 RAG 시스템,
멀티턴 챗봇, Tool을 호출하는 AI Agent 등 실제 서비스 단위의 평가도 검토할 수 있습니다.
① LLM 평가
- 기본 품질 및 성능:
요약, 분류, 질의응답, 논리 추론 정밀도 등 - Safety & Moderation:
유해성, 편향성, 법적·개인정보 관련 리스크 등 - 자동 평가 및 Benchmark:
Judge Prompt 등을 활용한 대규모 반복 평가와 정량 지표 산출
② RAG 평가
- Claim 단위 사실성 검증:
생성된 응답을 세부 지식 단위로 나눠 환각 여부를 확인합니다. - Retriever 성능:
사용자 질문에 적합한 Context를 정확히 가져왔는지 평가합니다. - Generator 성능:
검색된 문맥에 근거해 답변했는지와 사용자 의도 부합성을 평가합니다. - 평가 데이터 생성:
보유 문서를 활용해 평가용 Query와 Expected Response 데이터를 구성할 수 있습니다.
③ AI Agent 및 서비스 평가
- Multi-Turn 및 시나리오 평가:
연속 대화의 문맥 유지, Tone & Manner, 목적 달성 여부 등을 평가합니다. - Red Teaming:
Prompt Injection, Jailbreak 등 서비스의 안전 정책을 우회하려는 공격 시나리오를 검증합니다. - Human in the Loop:
자동 지표만으로 평가하기 어려운 항목을 전문가·사용자 관점의 Rubric 기반으로 함께 검토할 수 있습니다.
서비스에 따라 평가 방법을 설계합니다
표준화된 체크리스트를 동일하게 적용하기보다,
고객사가 어떤 데이터를 다루고 어떤 사용자 접점을 가지고 있는지,
어떤 리스크가 중요한지를 먼저 파악한 뒤 서비스 구조에 맞는 평가 항목과 시나리오를 설계합니다.
운영 환경을 초기에 공유해주시면 평가 범위와 방식을 구체적으로 제안할 수 있습니다.
A.
평가 결과는 주요 평가 지표와 발견된 이슈, 개선이 필요한 영역을 확인할 수 있도록
대시보드와 평가 결과 데이터 형태로 제공할 수 있습니다.
모델·서비스별 성능 비교와 세부 오류 분석을 통해 내부 보고와 향후 개선 방향을 검토할 수 있습니다.
상세 내용 보기
① 상세 평가 결과
- 종합 성과 확인:
Groundedness, Context Relevance, Safety 등 주요 지표와 모델 간 성능을 비교할 수 있습니다. - 평가 과정 및 판정 근거:
사용자 Query, Retriever Context, 생성 응답, 평가 결과와 판정 사유 등을 세부적으로 확인할 수 있습니다. - Claim 단위 오류 분석:
생성 답변의 어떤 부분에서 오류나 근거 불일치가 발생했는지 확인할 수 있습니다. - 결과 데이터 활용:
필요에 따라 결과 데이터를 추가 분석이나 내부 모니터링에 활용할 수 있습니다.
② 개선이 필요한 구간 진단
단순히 하나의 점수만 확인하는 것이 아니라,
문제가 어느 단계에서 발생했는지 분석할 수 있습니다.
- RAG 병목 진단:
Retriever의 검색 문제인지 Generator의 환각인지 등 오류가 발생한 구간을 분리해 확인합니다. - 프롬프트 및 지시 이행 분석:
Guardrail 우회, 지시 미이행 등 반복적인 실패 케이스를 확인할 수 있습니다. - 추가 개선 컨설팅:
필요 시 검색 방식이나 데이터셋 보강 등 개선 영역에 대한 전문 컨설팅을 별도로 검토할 수 있습니다.
③ 내부 보고 및 의사결정 자료
복잡한 기술 지표를 정량적인 결과로 정리해
AI 서비스의 상용화 준비도, 주요 리스크, 안전성 대응 수준 등을 내부에서 확인할 수 있습니다.
프로젝트 목적에 따라 내부 보고나 의사결정에 활용하기 위한 결과 자료 구성도 협의할 수 있습니다.
A.
네. RAG(Retrieval-Augmented Generation) 기반 서비스도 평가할 수 있습니다.
검색(Retrieval)과 생성(Generation) 단계를 각각 분석해 검색 품질,
답변 근거성, 환각 가능성, 사용자 질문과의 관련성 등 RAG 시스템 전체의 품질을 평가합니다.
상세 내용 보기
① 검색(Retrieval) 품질 평가
사용자의 질문에 대해 RAG 시스템이 외부 문서나 데이터베이스에서
필요한 Context를 적절하게 검색했는지 확인합니다.
이를 통해 Retriever가 관련성이 낮은 문서를 가져오거나 필요한 정보를 누락하는 문제를 확인할 수 있습니다.
② 답변 근거성 및 환각 평가
생성된 답변이 검색된 문서를 실제 근거로 사용하고 있는지,
근거에 없는 내용을 사실처럼 생성하지 않았는지 평가합니다.
필요에 따라 답변을 Claim 단위로 나눠 사실성과 근거 일치 여부를 세부적으로 확인할 수 있습니다.
③ 답변 관련성 평가
검색된 정보 자체가 정확해도 최종 답변이 사용자의 실제 질문 의도와 맞지 않을 수 있습니다.
따라서 생성된 답변이 질문에 적절하게 응답하고 있는지도 함께 평가합니다.
RAG의 어느 단계에서 문제가 발생했는지도 확인합니다
오류의 원인이
Retriever가 적절한 정보를 찾지 못한 것인지,
Generator가 검색된 정보를 제대로 활용하지 못한 것인지
구분해 RAG 파이프라인에서 개선이 필요한 구간을 확인할 수 있습니다.
