

무엇이 궁금하신가요?
무엇이 궁금하신가요?
AI 데이터 구축과 AI 신뢰성 평가에 대한 궁금한 내용을 검색하거나, 자주 찾는 주제를 확인해보세요.
AI Data
AI 학습 데이터 구축, 데이터셋 구매, 견적과 프로젝트 진행
A. 이미지, 텍스트, 음성, 영상, 문서, 멀티모달 등 다양한 형태의 AI 학습·평가 데이터 구축 및 가공을 지원합니다. 프로젝트 목적과 모델의 학습 방식에 맞춰 데이터 수집부터 가공·라벨링, 검수, 품질관리(QA)까지 필요한 범위를 검토하여 수행합니다.
프로젝트 진행 범위 자세히 보기
A.
네. 금융, 의료, 제조, 통신 등 다양한 산업과 공공·민간 분야에서
AI 데이터 수집, 가공, 라벨링, 검수 및 품질관리 프로젝트를 수행해왔습니다.
원하시는 산업군이나 데이터 유형을 알려주시면 관련성이 높은 유사 사례를 확인해 안내드립니다.
상세 내용 보기
금융, 의료, 원자력, 농기계, 국방, 통신 등 산업별 전문 데이터뿐 아니라
말뭉치 구축, 기업·공공기관 문서 전처리, 국가기관 및 공공기관 대상 데이터 구축 등 다양한 유형의 과업을 수행해왔습니다.
프로젝트마다 데이터 유형, 구축 목적, 품질 기준이 다르기 때문에
동일 산업 사례뿐 아니라 유사 데이터 유형, 작업 방식, 구축 규모 및 품질 기준을 함께 검토하여
참고 가능한 레퍼런스를 안내할 수 있습니다.
특정 산업이나 과업의 레퍼런스가 필요하다면 산업군·데이터 유형·구축 과업을 알려주세요.
다만 프로젝트에 따라 고객사 정보 및 NDA 등의 사유로 구체적인 사업명이나 세부 내용의 공개가 제한될 수 있습니다.
A.
네. 원본 데이터 수집부터 가공·라벨링, 검수, 품질관리(QA)까지 전 과정을 원스톱으로 진행할 수 있습니다.
프로젝트 목적과 모델 학습·평가 방식에 맞춰 기준을 협의하고, 필요하면 샘플 작업 또는 PoC를 먼저 진행할 수 있습니다.
상세 내용 보기
먼저 고객사 데이터와 프로젝트 목적을 기준으로 품질·가공 기준을 협의합니다.
이후 소량의 샘플 데이터를 우선 가공해 품질을 점검하고, 검토 결과를 반영해 최종 작업 기준을 확정합니다.
확정된 기준에 따라 전체 데이터를 구축한 뒤 결과물 검수와 QA를 거쳐 최종 데이터를 납품합니다.
프로젝트에 따라 본 작업 전 샘플 작업 또는 PoC를 통해 결과물의 품질과 작업 기준을 사전에 확인할 수도 있습니다.
A.
견적은 주로 ① 데이터 유형, ② 데이터 규모, ③ 라벨링 및 가공 난이도, ④ 검수·품질관리 기준, ⑤ 납기 일정 및 투입 리소스를 종합적으로 고려해 산정합니다.
프로젝트에 따라 M/M 또는 작업 물량에 따른 건별 단가 방식 등을 적용할 수 있습니다.
데이터 유형 · 데이터 규모 · 라벨링/가공 난이도 · 검수/QA 기준 · 납기 일정 · 투입 리소스
상세 내용 보기
이미지 바운딩 박스·세그멘테이션, OCR, 음성 전사, 문서 정제 등 작업 유형에 따라 필요한 인력과 작업 시간이 달라질 수 있습니다.
파견형은 일반적으로 파견 기간과 투입 인력에 따른 M/M 기준으로 산정하며,
비파견형은 관리·운영 M/M 비용과 실제 작업 물량에 따른 건별 단가를 조합하는 방식을 기본적으로 적용합니다.
과업의 난이도와 작업 범위가 명확한 경우 전체 과업을 M/M 기준으로 제안하거나,
작업 물량을 명확히 산정할 수 있는 경우 건별 단가 방식을 적용할 수 있습니다.
최종 견적 구조는 고객사의 예산·계약 방식·과업 특성을 고려해 협의합니다.
A.
네. 정식 견적 전 예산 검토를 위한 개략 견적을 받아보실 수 있습니다.
상세 내용 보기
전달해주신 정보를 바탕으로 예상 작업 범위와 투입 리소스를 검토하여 대략적인 비용 범위와 견적 구조를 안내드립니다.
개략 견적은 예산 검토 목적의 참고 견적이며,
상세 작업 기준, 실제 데이터, 과업 난이도와 작업량, 수행 방식에 따라 최종 견적은 달라질 수 있습니다.
보다 정확한 견적이 필요하다면 샘플 데이터와 구체적인 작업 기준을 바탕으로 사전 검토 또는 샘플 작업 후 최종 견적을 산정하는 것을 권장합니다.
필요한 정보가 충분한 경우 영업일 기준 1~3일 내 회신을 기본으로 하며,
과업 규모나 복잡도에 따라 추가 검토가 필요한 경우 별도로 안내드립니다.
A.
프로젝트 기간은 데이터 규모, 가공 난이도, 검수·품질관리 기준, 투입 인력과 희망 납기에 따라 달라집니다.
급한 일정이 있다면 추가 인력 투입이나 작업 우선순위 조정을 통해 일정 단축 가능 여부를 검토할 수 있습니다.
상세 내용 보기
데이터 가공 자체의 작업 시간뿐 아니라
기준 협의 → 샘플 작업 및 품질 검토 → 본 작업 → 검수·QA까지 전체 프로세스를 고려하여 일정을 산정합니다.
급한 완료 일정이나 별도 납기 조건이 있다면 내부 작업 인력을 추가 투입하거나 공정을 조정해 일정 단축 가능 여부를 검토할 수 있습니다.
이 경우 추가 리소스 투입 비용이 견적에 반영될 수 있습니다.
예상 데이터 규모, 작업 방식과 목표 납기를 알려주시면 수행 가능 범위와 적정 일정을 검토하여 안내드립니다.
A.
네. 보유 데이터셋은 제공 가능 여부와 라이선스 조건을 확인한 후 구매할 수 있습니다.
원하는 데이터가 없다면 외부 공급사를 통한 소싱이나 요구사항에 맞춘 신규 데이터셋 구축도 검토할 수 있습니다.
상세 내용 보기
데이터 유형, 필요 수량, 도메인·주제, 언어와 활용 목적을 알려주시면
당사 보유 데이터 및 공급사를 통해 소싱 가능한 데이터 범위와 제공 가능 여부를 확인합니다.
외부 공급사를 통해 데이터를 확보하는 경우에는 데이터 확보 가능 여부뿐 아니라
이용 목적에 따른 라이선스와 활용 범위도 함께 확인합니다.
따라서 동일한 데이터라도 활용 목적과 필요한 권리 범위에 따라 제공 가능 여부 및 비용이 달라질 수 있습니다.
보유 또는 소싱 가능한 데이터가 없다면 요구사항에 맞춘 신규 데이터 수집·가공 및 맞춤형 데이터셋 구축도 검토할 수 있습니다.
A.
네, 가능합니다.
보유 데이터셋에 원하시는 데이터가 없거나 특정 모델 학습 목적에 맞는 데이터 조건 및 품질 기준이 필요한 경우 맞춤형 데이터셋 구축으로 진행할 수 있습니다.
데이터 수집 기준, 라벨링·가공 기준, 검수·품질관리(QA) 기준을 함께 설계해 프로젝트 목적에 맞는 데이터셋을 구축합니다.
상세 내용 보기
맞춤 구축을 원하시는 경우
데이터 작업 가이드 및 요구사항, 필요 데이터 수량, 희망 완료 기한
을 전달해주시면,
이를 바탕으로 데이터 수집 가능 여부, 작업 범위, 예상 일정 및 수행 가능성을
우선 검토하여 안내드립니다.
과업에 따라 데이터 수집 단계부터
수집 대상 및 조건, 라벨링·가공 기준, 검수·품질관리(QA) 기준
을 함께 설계하여
프로젝트 목적에 맞는 데이터셋을 구축합니다.
필요한 경우 본 작업에 앞서 일부 샘플 데이터를 대상으로 먼저 작업하여,
작업 기준과 결과물의 품질을 사전에 확인·조정한 후 전체 구축
을 진행할 수도 있습니다.
단순 데이터 가공뿐만 아니라
요구사항에 맞는 원천 데이터 수급 → 가공·라벨링 → 검수 → 최종 데이터 구축
까지 일괄적으로 진행할 수 있습니다.
데이터 유형과 과업 난이도에 따라 구체적인 수행 방식과 일정은 협의하여 결정합니다.
A.
문의 접수 후 2영업일 이내 담당자를 배정하고 이메일 또는 유선으로 연락드립니다.
프로젝트 목적, 데이터 유형과 규모, 작업 방식, 일정과 예산 등을 확인한 뒤 적합한 수행 방식을 검토합니다.
상세 내용 보기
상담에서는 프로젝트 목적과 활용 용도, 데이터 유형과 보유 여부, 예상 규모,
희망 작업 방식 및 품질 기준, 일정·납기와 예산 범위 등을 중심으로 과업 내용을 파악합니다.
상세 데이터나 내부 자료 공유가 필요한 경우
NDA(비밀유지계약) 체결 후 구체적인 요구사항과 데이터를 확인할 수 있습니다.
또한 본 작업 전 결과물의 품질이나 기준을 확인하고 싶다면 샘플 작업 또는 PoC를 먼저 진행한 뒤 본 프로젝트로 확장할 수 있습니다.
문의 단계에서 모든 요구사항이 확정되어 있을 필요는 없습니다.
현재 확인 가능한 범위의 정보만 전달해주시면 담당자와 상담하면서 세부 작업 범위와 진행 방향을 구체화할 수 있습니다.
AI Evaluation
LLM 평가, AI Red Team, RAG, AI 신뢰성 검증
A.
LLM 평가는 AI 모델 또는 AI 서비스가 의도한 기준에 맞게 동작하는지 확인하는 과정입니다.
고객의 목적에 따라
LLM 자체 성능 평가, RAG 서비스 평가, AI 서비스 전체 검증으로
나누어 진행하며, 서비스 유형과 주요 리스크를 고려해 평가 범위와 시나리오를 설계합니다.
상세 내용 보기
① LLM 자체 평가
LLM 자체 평가는 특정 서비스 응용단을 제외하고,
모델이 보유한
언어 이해, 생성, 추론, 안전성 등 기본 역량을 종합적으로 측정하는 과정입니다.
표준화된 벤치마크와 평가 지표를 활용해 모델 자체의 지능과 안전성 범위를 검증할 수 있습니다.
- 지식 및 추론 평가:
텍스트 요약, 질의응답, 논리적 추론의 정밀도 등 - 안전성 및 윤리성 평가:
유해성, 편향성, 탈옥 방어율, 정보 유출 리스크 등 - 표준 벤치마크 평가:
MMLU, GSM8K, ARC, HumanEval 등 글로벌 벤치마크 기반 지표
이를 통해 도입 후보 모델 간 상대적인 성능을 비교하거나,
Fine-tuning 전후의 역량 변화를 측정하고,
기초 모델의 정량적인 안전성 수준을 확인할 수 있습니다.
② RAG 서비스 평가
RAG(Retrieval-Augmented Generation) 평가는 모델 자체의 지식뿐 아니라
외부 지식 베이스(문서, DB, 웹 검색 등)를 참조해 답변을 생성하는
RAG 시스템 전체 파이프라인의 정확성과 신뢰성을 검증하는 과정입니다.
검색(Retrieval)과 생성(Generation) 영역을 분리해
각 단계에서 발생할 수 있는 오류를 정밀하게 확인합니다.
- 검색 관련성:
사용자 질문에 적절한 Context를 찾아오는지 - 답변 근거성:
참조 문맥을 바탕으로 환각 없이 답변하는지 - 답변 관련성:
생성된 답변이 사용자의 질문과 의도에 부합하는지
이를 통해 환각을 줄이고 내부 지식 기반 질의응답의 정확도를 확인하며,
검색 엔진과 LLM 결합부에서 발생하는 병목 구간을 파악할 수 있습니다.
③ AI 서비스 전체 검증
AI 서비스 검증은 모델 단위의 성능 평가뿐 아니라,
실제 비즈니스 시나리오에서 AI 서비스 전체가 고객 요구사항과 비즈니스 목적을 충족하는지
확인하는 과정입니다.
- 도메인 특화 정확도:
실제 업무 시나리오에서 사용자의 요청을 제대로 처리하는지 - Edge Case 테스트:
이상치 입력, 악의적 공격, 모호한 질문 등에 대응하는지 - 사용자 관점 품질:
응답 속도, 답변 스타일의 일관성, 업무 효율성 등 - 모니터링 및 성능 유지:
출시 후 성능 저하를 감지하고 개선할 수 있는 검증 Loop
이를 통해 비즈니스 리스크를 줄이고,
서비스 상용화 단계에서 활용할 수 있는 객관적인 품질 기준을 마련할 수 있습니다.
DATUMO Eval은 어떻게 진행되나요?
고객사의 서비스 구조와 주요 리스크를 먼저 파악한 뒤
그에 맞는 평가 시나리오와 지표를 설계합니다.
평가 지표와 시나리오 설계가 어려운 경우에는 별도로 지원할 수 있으며,
실제 평가 실행과 결과 리포트 산출은
DATUMO Platform을 통해 진행합니다.
다만 평가 결과를 바탕으로
모델 자체를 직접 개선하는 작업은 제공 범위에 포함되지 않습니다.
셀렉트스타는 평가 솔루션 제공과 평가 환경 구축,
평가 실행과 결과 분석을 지원합니다.
A.
AI Red Team은 실제 공격이나 악용 가능성이 있는 시나리오를 바탕으로,
공격자의 관점에서 AI 시스템의 잠재적 위험과 취약점을 사전에 점검하는 평가 방식입니다.
서비스 특성에 따라 보안 취약점, 악용 시나리오, 프롬프트 공격 등을 중심으로 점검합니다.
상세 내용 보기
① 보안 취약점 점검
AI 서비스가 결합된 인프라, 파이프라인,
모델 인터페이스에서 발생할 수 있는
기술적 보안 취약점을 점검합니다.
- 시스템 프롬프트 및 내부 정보 유출:
악의적인 질의를 통해 시스템 내부의 비공개 프롬프트,
API Key, 내부 정책 로직 등이 노출될 수 있는지 테스트합니다. - 민감정보 및 개인정보 유출:
학습 데이터나 RAG 연동 DB에 포함된 개인정보,
금융정보 등 민감한 정보가 일반 사용자 질의를 통해
노출될 수 있는지 확인합니다. - 연계 시스템 보안 위험:
LLM이 생성한 결과가 내부 DB나 다른 시스템으로 전달되는 과정에서
SQL Injection, Remote Code Execution 등
2차적인 보안 사고로 이어질 가능성을 점검합니다.
② 악용 시나리오 점검
생성형 AI가 악의적인 목적으로 활용되거나,
사회적·비즈니스적 리스크를 유발할 수 있는
다양한 상황을 가정해 평가합니다.
- 유해 콘텐츠 및 사회적 위협:
Deepfake, 자살·자해 유도, 악성코드 작성 지원,
가짜뉴스 생성 등 사회적 위험을 유발할 가능성을 점검합니다. - 과도한 위임 및 Agent 권한 오용:
AI Agent가 사용자의 승인 없이 외부 API를 호출하거나,
무단 결제·데이터 삭제·관리자 명령 등
허용 범위를 넘어선 작업을 수행할 수 있는지 확인합니다. - 환각 기반 악용:
허위 정보를 사실처럼 응답하도록 유도했을 때
브랜드 신뢰도 저하나 법적·비즈니스 리스크로
이어질 가능성을 점검합니다.
③ 프롬프트 공격 점검
자연어의 특성을 악용해
AI 시스템의 제약 조건이나 안전 가드레일을 우회하려는
적대적인 프롬프트 공격 기법을 테스트합니다.
- 직접 프롬프트 인젝션:
기존 시스템 지시사항을 무시하도록 유도해
시스템 제약 조건을 무력화하려는 공격을 평가합니다. - 탈옥(Jailbreak):
역할극, 가상 시나리오, 인코딩 등의 방법으로
AI의 안전 가드레일을 우회할 수 있는지 확인합니다. - 간접 프롬프트 인젝션:
RAG 환경이나 Agent가 참조하는 외부 DB,
웹페이지, 문서 등에 악의적인 지시문을 포함시켰을 때
AI가 이를 처리하는 과정에서 의도하지 않은 동작이
발생할 가능성을 점검합니다.
서비스에 맞는 Red Team 시나리오를 설계합니다
레드팀 시나리오는 업종과 서비스 형태에 따라 달라집니다.
예를 들어 금융권 챗봇과 엔터테인먼트 캐릭터 챗봇은
주요 위험 요소와 점검해야 할 공격 지점 자체가 다를 수 있습니다.
내부 팀만으로 시나리오를 설계하면
공격자의 관점을 충분히 확보하기 어렵고,
자사 서비스에 익숙한 만큼 놓치는 지점이 생길 수 있습니다.
따라서 고객사의 서비스 구조와 주요 리스크를 먼저 확인한 뒤,
필요하면 서비스 특성에 맞는 Red Team 시나리오 설계를 함께 지원합니다.
DATUMO Platform에서는
이러한 레드티밍과 평가를 지원합니다.
다만 위험 응답이 실제 사용자에게 전달되는 순간
이를 실시간으로 차단하는
Guardrail은 레드티밍·평가와 별도의 영역입니다.
필요한 경우 협업 파트너를 통한 Guardrail 도입도 안내할 수 있습니다.
A.
AI 서비스는 기존 소프트웨어와 달리 동일한 입력에도 결과가 달라질 수 있으며,
환각, 편향성, 유해 응답, 개인정보 노출, 보안 취약점 등 다양한 리스크가 발생할 수 있습니다.
AI 신뢰성 평가는 이러한 불확실성과 위험을 사전에 확인하고,
서비스 출시와 개선을 위한 객관적인 판단 근거를 마련하는 과정
입니다.
상세 내용 보기
① 출시 전 리스크 점검
AI 서비스를 실제 사용자에게 제공하기 전에
운영 환경에서 발생할 수 있는 시스템 및 비즈니스 리스크를 확인합니다.
출시 이후 문제가 발생한 뒤 대응하기보다,
서비스 설계가 어느 정도 구체화된 단계부터 평가를 시작해 개선할 시간을 확보하는 것이 중요합니다.
- 서비스 품질 및 환각 점검:
AI가 사실과 다른 내용을 답하거나 문맥과 맞지 않는 답변을 생성하는지 평가합니다. - 보안 및 적대적 공격 점검:
프롬프트 인젝션, 탈옥, 민감정보 유출 등 악의적인 사용 시나리오에서
취약점이 발생하는지 확인합니다. - 브랜드 및 비즈니스 리스크 점검:
유해 콘텐츠, 편향된 발언, 잘못된 비즈니스 정보 등으로 인해
발생할 수 있는 서비스 신뢰도 저하와 비즈니스 리스크를 점검합니다.
② 규제 및 거버넌스 대응
AI 서비스의 위험을 어떤 항목과 기준으로 평가했는지 기록하고 정리하면
조직의 AI 거버넌스와 위험 관리 과정에서 활용할 수 있는 근거를 마련할 수 있습니다.
- 위험 기반 평가:
서비스에서 중요하게 관리해야 하는 위험 요소를 정의하고
이에 맞는 평가 기준과 데이터를 마련할 수 있습니다. - 평가 결과 기록:
평가 항목과 결과를 정량·정성 데이터로 관리해
내부 검토와 위험 관리에 활용할 수 있습니다. - 산업별 요구사항 검토:
금융, 공공 등 산업과 서비스 특성에 따라 필요한 평가 범위를
프로젝트 협의 과정에서 구체화할 수 있습니다.
※ 적용되는 법령·규제·표준과 세부 요구사항은 서비스 유형,
산업 및 프로젝트 범위에 따라 달라질 수 있으며,
구체적인 대응 범위는 프로젝트 협의 과정에서 확인합니다.
③ 내부 승인 및 의사결정
서비스 출시를 앞두면 경영진, 보안, 리스크 관리 등 여러 이해관계자가
AI 서비스를 실제 사용자에게 제공해도 되는지 판단해야 합니다.
이때 감이나 주관적인 판단이 아니라
어떤 항목을 어떤 기준으로 검증했는지 보여주는 평가 결과
가 의사결정의 근거가 될 수 있습니다.
- 데이터 기반 의사결정:
정확성, 근거성, 안전성 등 서비스에 필요한 지표를 활용해
현재 품질 수준을 확인할 수 있습니다. - 한계와 리스크 가시화:
현재 AI 서비스의 성능과 한계를 문서화해
추가 개선이 필요한 영역을 파악할 수 있습니다. - 출시 기준 마련:
서비스에 필요한 평가 기준과 목표 수준을 정하고
출시 여부를 판단하는 내부 기준으로 활용할 수 있습니다.
A.
LLM 기반 챗봇, RAG 서비스, AI Agent, 생성형 AI 서비스 등
다양한 AI 모델과 서비스를 평가할 수 있습니다.
온프레미스 sLM부터 외부 LLM API 기반 서비스까지 운영 방식과 서비스 구조에 맞춰 평가 범위와 시나리오를 설계합니다.
상세 내용 보기
평가 지원 모델 범위
- 상용 API 기반 모델
- 국내·외 오픈소스 모델
- 멀티모달 및 도메인 특화 모델
단일 LLM API부터 DB·외부 API와 연결된 RAG 시스템,
멀티턴 챗봇, Tool을 호출하는 AI Agent 등 실제 서비스 단위의 평가도 검토할 수 있습니다.
① LLM 평가
- 기본 품질 및 성능:
요약, 분류, 질의응답, 논리 추론 정밀도 등 - Safety & Moderation:
유해성, 편향성, 법적·개인정보 관련 리스크 등 - 자동 평가 및 Benchmark:
Judge Prompt 등을 활용한 대규모 반복 평가와 정량 지표 산출
② RAG 평가
- Claim 단위 사실성 검증:
생성된 응답을 세부 지식 단위로 나눠 환각 여부를 확인합니다. - Retriever 성능:
사용자 질문에 적합한 Context를 정확히 가져왔는지 평가합니다. - Generator 성능:
검색된 문맥에 근거해 답변했는지와 사용자 의도 부합성을 평가합니다. - 평가 데이터 생성:
보유 문서를 활용해 평가용 Query와 Expected Response 데이터를 구성할 수 있습니다.
③ AI Agent 및 서비스 평가
- Multi-Turn 및 시나리오 평가:
연속 대화의 문맥 유지, Tone & Manner, 목적 달성 여부 등을 평가합니다. - Red Teaming:
Prompt Injection, Jailbreak 등 서비스의 안전 정책을 우회하려는 공격 시나리오를 검증합니다. - Human in the Loop:
자동 지표만으로 평가하기 어려운 항목을 전문가·사용자 관점의 Rubric 기반으로 함께 검토할 수 있습니다.
서비스에 따라 평가 방법을 설계합니다
표준화된 체크리스트를 동일하게 적용하기보다,
고객사가 어떤 데이터를 다루고 어떤 사용자 접점을 가지고 있는지,
어떤 리스크가 중요한지를 먼저 파악한 뒤 서비스 구조에 맞는 평가 항목과 시나리오를 설계합니다.
운영 환경을 초기에 공유해주시면 평가 범위와 방식을 구체적으로 제안할 수 있습니다.
A.
평가 결과는 주요 평가 지표와 발견된 이슈, 개선이 필요한 영역을 확인할 수 있도록
대시보드와 평가 결과 데이터 형태로 제공할 수 있습니다.
모델·서비스별 성능 비교와 세부 오류 분석을 통해 내부 보고와 향후 개선 방향을 검토할 수 있습니다.
상세 내용 보기
① 상세 평가 결과
- 종합 성과 확인:
Groundedness, Context Relevance, Safety 등 주요 지표와 모델 간 성능을 비교할 수 있습니다. - 평가 과정 및 판정 근거:
사용자 Query, Retriever Context, 생성 응답, 평가 결과와 판정 사유 등을 세부적으로 확인할 수 있습니다. - Claim 단위 오류 분석:
생성 답변의 어떤 부분에서 오류나 근거 불일치가 발생했는지 확인할 수 있습니다. - 결과 데이터 활용:
필요에 따라 결과 데이터를 추가 분석이나 내부 모니터링에 활용할 수 있습니다.
② 개선이 필요한 구간 진단
단순히 하나의 점수만 확인하는 것이 아니라,
문제가 어느 단계에서 발생했는지 분석할 수 있습니다.
- RAG 병목 진단:
Retriever의 검색 문제인지 Generator의 환각인지 등 오류가 발생한 구간을 분리해 확인합니다. - 프롬프트 및 지시 이행 분석:
Guardrail 우회, 지시 미이행 등 반복적인 실패 케이스를 확인할 수 있습니다. - 추가 개선 컨설팅:
필요 시 검색 방식이나 데이터셋 보강 등 개선 영역에 대한 전문 컨설팅을 별도로 검토할 수 있습니다.
③ 내부 보고 및 의사결정 자료
복잡한 기술 지표를 정량적인 결과로 정리해
AI 서비스의 상용화 준비도, 주요 리스크, 안전성 대응 수준 등을 내부에서 확인할 수 있습니다.
프로젝트 목적에 따라 내부 보고나 의사결정에 활용하기 위한 결과 자료 구성도 협의할 수 있습니다.
A.
네. RAG(Retrieval-Augmented Generation) 기반 서비스도 평가할 수 있습니다.
검색(Retrieval)과 생성(Generation) 단계를 각각 분석해 검색 품질,
답변 근거성, 환각 가능성, 사용자 질문과의 관련성 등 RAG 시스템 전체의 품질을 평가합니다.
상세 내용 보기
① 검색(Retrieval) 품질 평가
사용자의 질문에 대해 RAG 시스템이 외부 문서나 데이터베이스에서
필요한 Context를 적절하게 검색했는지 확인합니다.
이를 통해 Retriever가 관련성이 낮은 문서를 가져오거나 필요한 정보를 누락하는 문제를 확인할 수 있습니다.
② 답변 근거성 및 환각 평가
생성된 답변이 검색된 문서를 실제 근거로 사용하고 있는지,
근거에 없는 내용을 사실처럼 생성하지 않았는지 평가합니다.
필요에 따라 답변을 Claim 단위로 나눠 사실성과 근거 일치 여부를 세부적으로 확인할 수 있습니다.
③ 답변 관련성 평가
검색된 정보 자체가 정확해도 최종 답변이 사용자의 실제 질문 의도와 맞지 않을 수 있습니다.
따라서 생성된 답변이 질문에 적절하게 응답하고 있는지도 함께 평가합니다.
RAG의 어느 단계에서 문제가 발생했는지도 확인합니다
오류의 원인이
Retriever가 적절한 정보를 찾지 못한 것인지,
Generator가 검색된 정보를 제대로 활용하지 못한 것인지
구분해 RAG 파이프라인에서 개선이 필요한 구간을 확인할 수 있습니다.
A.
LLM 기반 챗봇, RAG 서비스, AI Agent, 생성형 AI 서비스 등
다양한 AI 시스템의 평가를 검토할 수 있습니다.
모델 자체의 성능뿐 아니라
실제 서비스 환경에서의 응답 품질, 안전성, 검색·생성 품질과 서비스 시나리오
등을 고려해 평가 범위를 설계합니다.
상세 내용 보기
서비스 유형에 맞게 평가 범위를 설계합니다
동일한 모델을 사용하더라도 실제 서비스 구조와 다루는 데이터,
사용자 접점에 따라 중요한 리스크가 달라질 수 있습니다.
따라서 표준화된 체크리스트를 동일하게 적용하기보다
서비스 구조와 운영 환경을 먼저 파악한 뒤 필요한 평가 항목과 시나리오를 설계합니다.
온프레미스로 운영하는 sLM이나 외부 LLM API를 활용하는 서비스 등
운영 환경에 대해서도 초기 상담에서 확인한 후
구체적인 평가 범위와 방식을 제안합니다.
LLM 평가
- 기본 품질 및 성능:
요약, 분류, 질의응답, 논리적 추론 등 모델의 기본 성능을 평가합니다. - 안전성:
유해성, 편향성, 개인정보 및 민감정보 노출 등
서비스에서 발생할 수 있는 안전성 리스크를 점검합니다. - 자동 평가 및 정량화:
평가 기준에 따라 반복적인 평가를 수행하고
결과를 정량적으로 비교·분석할 수 있습니다.
RAG 평가
- 검색 품질:
사용자의 질문에 대해 Retriever가 관련 문맥을 적절하게 가져오는지 평가합니다. - 답변 근거성:
검색된 문맥을 기반으로 답변이 생성됐는지,
근거 없이 생성된 내용이나 환각이 있는지 확인합니다. - 답변 관련성:
생성된 답변이 사용자의 질문과 의도에 적절하게 부합하는지 평가합니다. - 평가 데이터 구축:
서비스에 필요한 질문과 기대 응답 등
평가에 활용할 데이터셋을 구성할 수 있습니다.
AI Agent 및 서비스 평가
- Multi-Turn 및 시나리오 평가:
연속적인 대화에서 문맥을 유지하는지,
답변 스타일과 목적 달성 여부 등을 평가할 수 있습니다. - Red Teaming:
프롬프트 공격, 탈옥 등 적대적인 시나리오를 활용해
서비스의 안전성 취약점을 점검할 수 있습니다. - Human-in-the-Loop:
자동 지표만으로 판단하기 어려운 항목은
전문가 또는 사용자 관점의 평가 기준을 활용해 검토할 수 있습니다.
사용 중인 모델과 서비스 환경을 상담 시 공유해주시면
평가 가능한 범위와 방식을 구체적으로 안내드립니다.
관련 콘텐츠
AI 데이터 구축과 AI 신뢰성 평가에 대해 더 자세히 알아보세요.
AI 학습데이터 구축: 셀렉트스타의 전략과 사례
AI 모델에 필요한 고품질 학습데이터를 어떻게 설계하고 구축하는지 사례와 함께 살펴봅니다.
AI 학습데이터의 중요성
AI 성능을 높이기 위해 어떤 데이터를 수집하고 어떻게 품질을 관리해야 하는지 알아봅니다.
Data-Centric AI, 학습 데이터의 중요성
모델 중심에서 데이터 중심 AI로 변화하는 흐름과 학습 데이터의 역할을 살펴봅니다.
LLM 평가 지표, 왜 중요할까?
안전성, RAG 품질 등 LLM을 평가할 때 확인할 수 있는 주요 평가 영역과 지표를 알아봅니다.
LLM 평가의 새로운 기준
정확성, 관련성, 유해성, 정보보안성 등 AI 성능과 신뢰성을 평가하는 방법을 소개합니다.
생성형 AI 레드티밍 방법과 전략
공격 시나리오 설계부터 운영 체계까지 AI Red Team을 조직에 적용하는 방법을 알아봅니다.