본문으로 건너뛰기

← 2026.08.04 뉴스레터

2026.08.04 발표 · Mistral AI

SECURITY (보안·안전)

미스트랄 'Shieldstral'… 3B 공개 멀티모달 안전 분류기

미스트랄이 AI 서비스의 입력·출력을 걸러 내는 공개 안전 분류기 Shieldstral을 Apache 2.0으로 내놨습니다. 30억 파라미터의 작은 모델로 16GB GPU 한 장에서 돌고, 최대 7배 큰 공개 안전 모델과 비슷하거나 더 낫다고 밝혔습니다. 특징은 정책을 모델에 고정하지 않고, '이 콘텐츠가 특정 집단에 대한 폭력을 조장하나?' 같은 질문을 실행할 때 글로 넣으면 안전 점수를 돌려준다는 것입니다.

핵심 사실 · 한눈에 보기

  • 8월 4일 미스트랄이 30억(3B) 파라미터 공개 멀티모달 안전 분류기 Shieldstral을 Apache 2.0 라이선스로 공개했습니다.
  • 정책을 자연어 질문으로 넣으면 다시 학습하지 않고도 새 정책에 맞춰 판단하며, 텍스트와 이미지를 하나의 방식으로 평가합니다.
  • 답을 '예/아니오' 확률로 계산해 연속적인 안전 점수를 돌려주므로, 기준값을 정하거나 확신도 순으로 정렬할 수 있습니다.
  • 16GB GPU 한 장에서 돌며, 텍스트 안전·거절 탐지·정책 적응·멀티모달 평가에서 최대 7배 큰 공개 모델과 같거나 앞선다고 밝혔습니다.
  • 미스트랄은 엔비디아 등과 함께하는 Open Secure AI Alliance의 창립 회원으로 이 모델을 공개했다고 밝혔습니다.

어떻게 판단하나

기존 안전 모델 상당수는 '폭력', '혐오' 같은 정해진 분류 체계를 학습해 두기 때문에, 서비스 성격이 바뀌면 다시 학습해야 합니다. 같은 내용이라도 보안 연구 도구에서는 괜찮고 정신건강 서비스에서는 해로울 수 있는데, 하나의 고정된 기준으로는 이를 다루기 어렵다는 것이 미스트랄의 문제의식입니다.

Shieldstral은 요청을 세 부분으로 받습니다. 평가 맥락과 엄격도(선택적으로 무엇이 위험한지 정의), 예/아니오로 답할 질문 하나, 그리고 판단할 내용(프롬프트, 응답, 둘의 쌍, 이미지와 글)입니다. 모델은 '예'와 '아니오'에 대한 확률만 읽어 점수로 바꿉니다.

  • 하나의 방식으로 프롬프트 분류, 응답 검수, 거절 감지, 유해성 탐지
  • 정책은 질문 형태로 실행 시 교체
  • 비슷해서 헷갈리는 정책 쌍으로 학습해, 처음 보는 정책도 구분하도록 설계

AI마중 POINT · 해석

봐야 할 지점

AI 서비스에 넣을 '안전 필터'를 직접 내려받아 돌릴 수 있는 공개 모델이 늘고 있습니다. 작은 모델이라 서비스 앞단에서 모든 요청을 검사해도 비용 부담이 적고, 데이터를 외부 API로 보내지 않아도 됩니다. 정책을 글로 바꿀 수 있다는 점은 서비스마다 기준이 다른 현실에 맞춘 설계입니다.

다만 성능 비교는 미스트랄 발표 기준이고, 안전 분류기의 성능은 어떤 언어·문화권의 데이터로 학습했는지에 크게 좌우됩니다. 한국어 욕설이나 은어, 한국 맥락의 혐오 표현을 얼마나 잡는지는 직접 시험해야 합니다.

그래서 나한테는?

누구에게 쓸모 있나

  • AI 서비스 개발자: 유해 입력·출력 필터로 시험해 볼 수 있습니다. 서비스 정책을 질문 형태로 적어 넣고, 점수 기준값을 조정하면 됩니다.
  • 이미지가 오가는 서비스: 텍스트와 이미지를 같은 방식으로 검사할 수 있습니다.
  • 한국어 서비스: 실제 운영 데이터 일부로 정확도를 먼저 확인하는 것이 필요합니다.

미확인 · 공식 발표만으로 알 수 없는 것

확인할 것

  • 언어별 성능, 특히 한국어 결과는 공개되지 않았습니다.
  • 이 사이트 기록상 같은 달 20일 미스트랄은 복잡한 문서 안에서 정보를 찾고 검증하는 'Agentic Search'도 발표했습니다. 별개 제품입니다.

SOURCE공식 원문 + 추가 출처

수집 2026.09.30 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.

같은 주제 · Mistral

Mistral 전체 →