멀티모달
AI의 성능을 높이는
데이터 설계
텍스트·이미지·음성·영상을 단순히 결합하지 않고, 의미·시간·공간의 관계를 맞춰 모델이 학습할 수 있는 구조로 설계합니다.
멀티모달 AI, 왜 어려울까요?
모달리티를 단순히 이어붙이는 것만으로 모델이 관계를 제대로 학습하기 어렵습니다.
연결 ≠ 이해
이미지와 텍스트가 나란히 함께 있어도 서로의 의미 관계가 맞지 않으면 제대로 학습하기 어렵습니다.
결합 ≠ 정합
시간·공간 정보가 조금만 어긋나면 맥락이 깨지고 추론 오류가 커집니다.
규모 ≠ 성능
모델 목적에 맞지 않는 데이터는 규모와 상관없이 재가공과 추가 튜닝이 필요합니다.
AI가 이해하는 데이터 관계 설계
각 데이터가 서로 어떤 의미로 연결되고, 언제 어디서 맞물리며, 어떤 방식으로 학습될지까지 설계합니다.
이미지 · 텍스트 · 음성 · 영상
의미 정합 설계
Semantic Alignment
시간·공간 정합 설계
Temporal · Spatial Alignment
모델 맞춤형 구조 설계
Task-driven Structuring
신뢰할 수 있는 AI
의미 정합 설계
이미지·텍스트·음성이 동일한 의미를 가리키도록 연결합니다.
EXPECTED
의미 불일치 감소
환각(Hallucination) 위험 완화
환각(Hallucination) 위험 완화
시간·공간 정합 설계
객체 위치, 시간 흐름, 문맥 관계를 정렬합니다.
EXPECTED
추론 신뢰성 향상
위치·맥락 오류 감소
위치·맥락 오류 감소
모델 맞춤형 구조 설계
Instruction, VQA, CoT 등 학습 목적에 맞게 데이터를 구조화합니다.
EXPECTED
학습 적합성 향상
추가 튜닝 부담 감소
추가 튜닝 부담 감소
활용 가능한 AI 서비스
이미지 이해
- 이미지 캡셔닝
- VQA
- 객체 인식 및 관계 이해
문서 이해
- OCR
- 표·차트·도면 구조화
- 문서 기반 질의응답(Document QA)
영상 이해
- 이벤트 인식
- 행동 분석
- 장면 이해
음성 이해
- 음성 전사(STT)
- 화자 분리
- 의미 분석
멀티모달 추론
- Image + Text QA
- Multi-hop 추론
- CoT 기반 추론
AI 에이전트
- 멀티모달 기반 의사결정
- Tool Calling
- Planning
Text
인식

분류

수집

전사

번역

요약

Image
바운딩박스

폴리곤

키포인트

곡선형

전사

폴리라인

세그멘테이션

Video
내용 분석
모션 트래킹
세그멘테이션

Audio
수집

전사

태깅

3D LiDAR
큐보이드

자율 주행

셀렉트스타는 다릅니다
멀티모달 구축 역량
- 텍스트·이미지·음성·영상 전 영역 프로젝트 수행
- 자체 플랫폼 기반의 안정적인 데이터 생산 체계
- 약사·엔지니어·화학 등 고난도 도메인 전문가 풀
- 단계별 검수·관리 프로세스를 통한 품질 관리
모달 간 정합 설계
- 의미·시간·공간 관계를 고려한 모달 간 정합 설계
- 모델 학습 목적에 맞춘 데이터 구조화
- VQA·Instruction·CoT 등 학습 방식 반영
모델 적용 파이프라인
- 학습부터 평가까지 연계한 데이터셋 설계
- Instruction·CoT·Multi-hop 등 추론 방식 반영
- 모델 성능 검증을 위한 평가 데이터 구축
- 모델 적용을 고려해 재가공과 추가 튜닝 부담 감소
사례로 증명합니다
셀렉트스타는 다양한 모달리티 간 관계와 추론 구조를 반영한 AI 프로젝트 데이터를 구축해왔습니다.
Data-Centric AI AI 성능 개선, 데이터로부터 시작됩니다.
AI 평가 솔루션 기업
AI 성능부터 안전성까지
셀렉트스타는 AI 성능을 좌우하는 고품질 학습 데이터는 물론,
모델 안전성을 검증하기 위한 전문 컨설팅과 자체 개발 자동화 플랫폼을 제공합니다.
국내 최초 AI 신뢰성 검증 자동화 솔루션, 다투모 이밸
누적 2.5억 건 이상 데이터 구축
글로벌 서비스
기업 고객 330+
NeurIPS EMNLP CVPR 등 글로벌 탑 티어 학회 등재


















