...

문의 전 자주 묻는 질문

데이터 구축 비용과 일정부터 LLM 평가 범위와 결과까지.

AI 데이터 구축

Q. 어떤 AI 데이터를 구축할 수 있나요?

A.
이미지, 텍스트, 음성, 영상, 문서, 멀티모달 등
다양한 형태의 AI 학습·평가 데이터 구축 및 가공을 지원합니다.
프로젝트 목적과 모델의 학습 방식에 맞춰 데이터 수집부터 가공·라벨링, 검수, 품질관리(QA)까지 필요한 범위를 검토하여 수행합니다.

대표 데이터 유형
01
이미지 데이터
데이터 수집, 객체 분류, BBOX, 세그멘테이션, 키포인트 등 이미지 라벨링
02
텍스트 데이터
AI 학습·요약·인스트럭션 데이터, 문서·텍스트 정제 및 OCR
03
음성 데이터
음성 전사(STT), 음성 데이터 수집 및 녹음
04
멀티모달 데이터
이미지+텍스트, 음성+텍스트 등 서로 다른 데이터 유형을 결합한 데이터
05
기업 문서 데이터
사내 문서 전처리·정제·구조화 및 AI 학습·검색 활용 데이터 가공
06
영상 데이터
영상 내 객체·행동·구간 분석 및 프로젝트 목적에 따른 라벨링
프로젝트 진행 범위 자세히 보기
전문 도메인 대응
의료·금융·법률·제조·교육 등 전문 데이터는 요구사항과 난이도를 사전 검토하고, 필요한 경우 해당 분야의 전문 인력 또는 전문가를 섭외합니다.
새로운 유형도 사전 검토
위에 명시되지 않은 데이터도 샘플과 작업 요구사항을 바탕으로 수행 가능 여부와 적합한 작업 방식을 안내합니다.
전체 과정 원스톱 지원
단순 라벨링뿐 아니라 데이터 수집 → 가공·라벨링 → 검수 → 품질관리까지 전체 구축 과정에 대응합니다.
Q. 비용은 어떻게 산정되나요?

A.
견적은 주로 ① 데이터 유형, ② 데이터 규모, ③ 라벨링 및 가공 난이도, ④ 검수·품질관리 기준, ⑤ 납기 일정 및 투입 리소스를 종합적으로 고려해 산정합니다.
프로젝트에 따라 M/M 또는 작업 물량에 따른 건별 단가 방식 등을 적용할 수 있습니다.

주요 견적 요소
데이터 유형 · 데이터 규모 · 라벨링/가공 난이도 · 검수/QA 기준 · 납기 일정 · 투입 리소스
상세 내용 보기

이미지 바운딩 박스·세그멘테이션, OCR, 음성 전사, 문서 정제 등 작업 유형에 따라 필요한 인력과 작업 시간이 달라질 수 있습니다.

파견형은 일반적으로 파견 기간과 투입 인력에 따른 M/M 기준으로 산정하며,
비파견형은 관리·운영 M/M 비용과 실제 작업 물량에 따른 건별 단가를 조합하는 방식을 기본적으로 적용합니다.

과업의 난이도와 작업 범위가 명확한 경우 전체 과업을 M/M 기준으로 제안하거나,
작업 물량을 명확히 산정할 수 있는 경우 건별 단가 방식을 적용할 수 있습니다.
최종 견적 구조는 고객사의 예산·계약 방식·과업 특성을 고려해 협의합니다.

Q. 프로젝트는 얼마나 걸리나요?

A.
프로젝트 기간은 데이터 규모, 가공 난이도, 검수·품질관리 기준, 투입 인력과 희망 납기에 따라 달라집니다.
급한 일정이 있다면 추가 인력 투입이나 작업 우선순위 조정을 통해 일정 단축 가능 여부를 검토할 수 있습니다.

상세 내용 보기

데이터 가공 자체의 작업 시간뿐 아니라
기준 협의 → 샘플 작업 및 품질 검토 → 본 작업 → 검수·QA까지 전체 프로세스를 고려하여 일정을 산정합니다.

급한 완료 일정이나 별도 납기 조건이 있다면 내부 작업 인력을 추가 투입하거나 공정을 조정해 일정 단축 가능 여부를 검토할 수 있습니다.
이 경우 추가 리소스 투입 비용이 견적에 반영될 수 있습니다.

예상 데이터 규모, 작업 방식과 목표 납기를 알려주시면 수행 가능 범위와 적정 일정을 검토하여 안내드립니다.

LLM·AI 서비스 평가

Q. LLM 평가는 무엇인가요?

A.
LLM 평가는 AI 모델 또는 AI 서비스가 의도한 기준에 맞게 동작하는지 확인하는 과정입니다.
고객의 목적에 따라
LLM 자체 성능 평가, RAG 서비스 평가, AI 서비스 전체 검증으로
나누어 진행하며, 서비스 유형과 주요 리스크를 고려해 평가 범위와 시나리오를 설계합니다.

주요 평가 영역
01
LLM 자체 평가
언어 이해·생성·추론 능력과 안전성 평가
02
RAG 서비스 평가
검색 품질·답변 근거성·환각 가능성 평가
03
AI 서비스 전체 검증
실제 서비스 환경에서 품질·안전성·운영 적합성 검증

상세 내용 보기

① LLM 자체 평가

LLM 자체 평가는 특정 서비스 응용단을 제외하고,
모델이 보유한
언어 이해, 생성, 추론, 안전성 등 기본 역량을 종합적으로 측정하는 과정입니다.
표준화된 벤치마크와 평가 지표를 활용해 모델 자체의 지능과 안전성 범위를 검증할 수 있습니다.

주요 평가 항목
  • 지식 및 추론 평가:
    텍스트 요약, 질의응답, 논리적 추론의 정밀도 등
  • 안전성 및 윤리성 평가:
    유해성, 편향성, 탈옥 방어율, 정보 유출 리스크 등
  • 표준 벤치마크 평가:
    MMLU, GSM8K, ARC, HumanEval 등 글로벌 벤치마크 기반 지표

이를 통해 도입 후보 모델 간 상대적인 성능을 비교하거나,
Fine-tuning 전후의 역량 변화를 측정하고,
기초 모델의 정량적인 안전성 수준을 확인할 수 있습니다.

② RAG 서비스 평가

RAG(Retrieval-Augmented Generation) 평가는 모델 자체의 지식뿐 아니라
외부 지식 베이스(문서, DB, 웹 검색 등)를 참조해 답변을 생성하는
RAG 시스템 전체 파이프라인의 정확성과 신뢰성을 검증하는 과정입니다.

검색(Retrieval)과 생성(Generation) 영역을 분리해
각 단계에서 발생할 수 있는 오류를 정밀하게 확인합니다.

  • 검색 관련성:
    사용자 질문에 적절한 Context를 찾아오는지
  • 답변 근거성:
    참조 문맥을 바탕으로 환각 없이 답변하는지
  • 답변 관련성:
    생성된 답변이 사용자의 질문과 의도에 부합하는지

이를 통해 환각을 줄이고 내부 지식 기반 질의응답의 정확도를 확인하며,
검색 엔진과 LLM 결합부에서 발생하는 병목 구간을 파악할 수 있습니다.

③ AI 서비스 전체 검증

AI 서비스 검증은 모델 단위의 성능 평가뿐 아니라,

실제 비즈니스 시나리오에서 AI 서비스 전체가 고객 요구사항과 비즈니스 목적을 충족하는지

확인하는 과정입니다.

  • 도메인 특화 정확도:
    실제 업무 시나리오에서 사용자의 요청을 제대로 처리하는지
  • Edge Case 테스트:
    이상치 입력, 악의적 공격, 모호한 질문 등에 대응하는지
  • 사용자 관점 품질:
    응답 속도, 답변 스타일의 일관성, 업무 효율성 등
  • 모니터링 및 성능 유지:
    출시 후 성능 저하를 감지하고 개선할 수 있는 검증 Loop

이를 통해 비즈니스 리스크를 줄이고,
서비스 상용화 단계에서 활용할 수 있는 객관적인 품질 기준을 마련할 수 있습니다.

DATUMO Eval은 어떻게 진행되나요?

고객사의 서비스 구조와 주요 리스크를 먼저 파악한 뒤
그에 맞는 평가 시나리오와 지표를 설계합니다.

평가 지표와 시나리오 설계가 어려운 경우에는 별도로 지원할 수 있으며,
실제 평가 실행과 결과 리포트 산출은
DATUMO Platform을 통해 진행합니다.

다만 평가 결과를 바탕으로
모델 자체를 직접 개선하는 작업은 제공 범위에 포함되지 않습니다.
셀렉트스타는 평가 솔루션 제공과 평가 환경 구축,
평가 실행과 결과 분석을 지원합니다.

Q. 어떤 모델과 서비스를 평가할 수 있나요?

A.
LLM 기반 챗봇, RAG 서비스, AI Agent, 생성형 AI 서비스 등
다양한 AI 모델과 서비스를 평가할 수 있습니다.
온프레미스 sLM부터 외부 LLM API 기반 서비스까지 운영 방식과 서비스 구조에 맞춰 평가 범위와 시나리오를 설계합니다.

주요 평가 범위
01
LLM
모델 성능·추론·안전성·편향성 등 평가
02
RAG
검색 성능·근거성·환각·답변 관련성 평가
03
AI Agent·서비스
Multi-Turn·Tool 사용·Red Teaming·사용자 관점 평가
상세 내용 보기

평가 지원 모델 범위

  • 상용 API 기반 모델
  • 국내·외 오픈소스 모델
  • 멀티모달 및 도메인 특화 모델

단일 LLM API부터 DB·외부 API와 연결된 RAG 시스템,
멀티턴 챗봇, Tool을 호출하는 AI Agent 등 실제 서비스 단위의 평가도 검토할 수 있습니다.

① LLM 평가

  • 기본 품질 및 성능:
    요약, 분류, 질의응답, 논리 추론 정밀도 등
  • Safety & Moderation:
    유해성, 편향성, 법적·개인정보 관련 리스크 등
  • 자동 평가 및 Benchmark:
    Judge Prompt 등을 활용한 대규모 반복 평가와 정량 지표 산출

② RAG 평가

  • Claim 단위 사실성 검증:
    생성된 응답을 세부 지식 단위로 나눠 환각 여부를 확인합니다.
  • Retriever 성능:
    사용자 질문에 적합한 Context를 정확히 가져왔는지 평가합니다.
  • Generator 성능:
    검색된 문맥에 근거해 답변했는지와 사용자 의도 부합성을 평가합니다.
  • 평가 데이터 생성:
    보유 문서를 활용해 평가용 Query와 Expected Response 데이터를 구성할 수 있습니다.

③ AI Agent 및 서비스 평가

  • Multi-Turn 및 시나리오 평가:
    연속 대화의 문맥 유지, Tone & Manner, 목적 달성 여부 등을 평가합니다.
  • Red Teaming:
    Prompt Injection, Jailbreak 등 서비스의 안전 정책을 우회하려는 공격 시나리오를 검증합니다.
  • Human in the Loop:
    자동 지표만으로 평가하기 어려운 항목을 전문가·사용자 관점의 Rubric 기반으로 함께 검토할 수 있습니다.

서비스에 따라 평가 방법을 설계합니다

표준화된 체크리스트를 동일하게 적용하기보다,
고객사가 어떤 데이터를 다루고 어떤 사용자 접점을 가지고 있는지,
어떤 리스크가 중요한지를 먼저 파악한 뒤 서비스 구조에 맞는 평가 항목과 시나리오를 설계합니다.
운영 환경을 초기에 공유해주시면 평가 범위와 방식을 구체적으로 제안할 수 있습니다.

Q. 평가 결과는 어떻게 제공되나요?

A.
평가 결과는 주요 평가 지표와 발견된 이슈, 개선이 필요한 영역을 확인할 수 있도록
대시보드와 평가 결과 데이터 형태로 제공할 수 있습니다.
모델·서비스별 성능 비교와 세부 오류 분석을 통해 내부 보고와 향후 개선 방향을 검토할 수 있습니다.

주요 결과 제공 영역
01
평가 결과
핵심 지표·모델 비교·세부 오류와 판정 근거 확인
02
개선 영역 진단
RAG 병목·환각·지시 불이행 등 실패 원인 분석
03
내부 보고 자료
상용화 준비도·핵심 리스크·안전성 수준을 의사결정에 활용
상세 내용 보기

① 상세 평가 결과

  • 종합 성과 확인:
    Groundedness, Context Relevance, Safety 등 주요 지표와 모델 간 성능을 비교할 수 있습니다.
  • 평가 과정 및 판정 근거:
    사용자 Query, Retriever Context, 생성 응답, 평가 결과와 판정 사유 등을 세부적으로 확인할 수 있습니다.
  • Claim 단위 오류 분석:
    생성 답변의 어떤 부분에서 오류나 근거 불일치가 발생했는지 확인할 수 있습니다.
  • 결과 데이터 활용:
    필요에 따라 결과 데이터를 추가 분석이나 내부 모니터링에 활용할 수 있습니다.

② 개선이 필요한 구간 진단

단순히 하나의 점수만 확인하는 것이 아니라,
문제가 어느 단계에서 발생했는지 분석할 수 있습니다.

  • RAG 병목 진단:
    Retriever의 검색 문제인지 Generator의 환각인지 등 오류가 발생한 구간을 분리해 확인합니다.
  • 프롬프트 및 지시 이행 분석:
    Guardrail 우회, 지시 미이행 등 반복적인 실패 케이스를 확인할 수 있습니다.
  • 추가 개선 컨설팅:
    필요 시 검색 방식이나 데이터셋 보강 등 개선 영역에 대한 전문 컨설팅을 별도로 검토할 수 있습니다.

③ 내부 보고 및 의사결정 자료

복잡한 기술 지표를 정량적인 결과로 정리해
AI 서비스의 상용화 준비도, 주요 리스크, 안전성 대응 수준 등을 내부에서 확인할 수 있습니다.
프로젝트 목적에 따라 내부 보고나 의사결정에 활용하기 위한 결과 자료 구성도 협의할 수 있습니다.

국내 최초 AI 신뢰성 검증 자동화 솔루션, 다투모 이밸
누적 2.5억 건 이상 데이터 구축
글로벌 서비스
기업 고객 330+
NeurIPS EMNLP CVPR 등 글로벌 탑 티어 학회 등재

AI 흐름을 놓치지 마세요