블로그·AI 벤치마크

GPT vs Gemini vs 산업안전 특화 AI — 같은 사진, 다른 분석

현장 사진 한 장, 동일 프롬프트. 세 AI에 똑같이 물었더니 결과가 완전히 달랐습니다. 개수가 아니라 "무엇이 따라오느냐"가 갈렸습니다.

Heinrich Research7분 읽기

안녕하세요, 산업안전 AI Heinrich 팀입니다. 오늘은 안전관리자분들이 한 번쯤 궁금해하실 실험 결과를 공유드립니다.

현장 사진을 ChatGPT에 올려 위험요인 분석을 요청해 보신 적 있으신가요? 결과가 길게 나와 처음엔 만족했는데, 막상 현장에 적용하려니 우선순위 판단이 안 되셨던 경험 — 저희도 똑같이 했습니다. 그래서 같은 사진 한 장으로 GPT-5.4, Gemini 3.1 Pro, 산업안전 특화 AI 세 개를 동시에 비교했습니다.

동일 사진 + 동일 프롬프트로 3개 AI 비교
동일 사진 + 동일 프롬프트로 3개 AI 비교

GPT-5.4 — 15개를 찾았지만

GPT-5.4는 무려 15개의 위험요인을 찾아냈습니다. 처음엔 "역시 GPT"였는데, 자세히 보니 이런 문제가 있었습니다.

  • 위험 등급 산정 없음 (전부 동일 비중)
  • 실제 사고 근거 인용 0건
  • 적용 법규(KOSHA·OSHA) 명시 없음
  • 위험 간 연쇄 분석 없음

쉽게 말해 "발끝막이판 누락"처럼 추락 사망으로 직결되는 항목과 "느슨한 케이블"처럼 정리하면 되는 항목이 똑같은 한 줄로 처리됐습니다.

GPT-5.4: 15개 검출 — 등급·근거·법규 모두 없음
GPT-5.4: 15개 검출 — 등급·근거·법규 모두 없음

Gemini 3.1 Pro — 5개, 하지만 격리된 위험

같은 사진을 Gemini 3.1 Pro에 넣자 5개가 나왔습니다. 개수는 줄었지만 똑똑해진 건 아니었습니다 — 위험요인별 개별 등급 없음, 실제 사고 매칭 0건, 연쇄고장 분석 전무. 모든 위험을 독립적으로 처리했습니다.

Gemini 3.1 Pro: 5개 검출, 일반 매트릭스로 부분 점수화
Gemini 3.1 Pro: 5개 검출, 일반 매트릭스로 부분 점수화

산업안전 특화 AI — 4개, 그런데 전부 다르다

같은 사진을 산업안전에 학습된 AI에 넣었더니 이번엔 4개가 나왔습니다. "이게 다인가?" 싶었지만 — 4개 모두 등급 + 근거 + 법규가 함께 따라왔습니다.

검출 결과 (등급·근거·법규 포함)
  • #1 [CRITICAL] 가드레일·경고테이프 결함 — 5/5 (사고사례 12건 매칭, OSHA 1926.502)
  • #2 [CRITICAL] 안전대 미체결 — 5/5 (KOSHA G-26)
  • #3 [HIGH] 비계 위 정리정돈 불량 — 4/5 (ISO 45001:6.1)
  • #4 [MODERATE] 전동 공구·노출 케이블 — 3/5 (NFPA 70E)

총 위험 점수 25/25 → "STOP WORK" 권고까지 자동으로 나옵니다.

산업안전 AI: 4개 모두 등급+근거+법규 포함
산업안전 AI: 4개 모두 등급+근거+법규 포함

어떻게 등급을 매기나 — 5×5 위험성 매트릭스

Probability(발생확률) × Severity(심각도)로 위험요인별 1~25점이 산정됩니다. 20점 이상 STOP WORK / 15~19 CRITICAL / 10~14 HIGH / 5~9 MODERATE. GPT·Gemini는 매트릭스가 없어 "이 위험이 즉시 작업중지 사유인지" 판단할 근거가 부족합니다.

5×5 위험성 매트릭스 (P × S)
5×5 위험성 매트릭스 (P × S)

진짜 위험은 "체인"이다

실제 사고는 단일 원인으로 일어나지 않습니다 — 연쇄로 일어납니다. 흩어진 공구 → 가장자리 비틀거림 → 가드레일 부재 → 안전대 미체결 → 치명적 추락. GPT는 15개를 별개로, Gemini도 격리된 위험으로 봤지만, 산업안전 특화 AI만 이 체인을 매핑해 "이 4개가 합쳐지면 사망 시퀀스가 된다"고 명시했습니다.

"많이 찾는 것"은 분석이 아니라 소음입니다. 안전관리자에게 필요한 건 우선순위가 매겨진 4개입니다.
4개 위험요인이 결합되는 사망 시퀀스
4개 위험요인이 결합되는 사망 시퀀스

16건의 법규 자동 인용

산업안전 특화 AI는 모든 위험요인에 감사관이 실제로 확인하는 조항을 자동 인용합니다 — OSHA 1926.502(가드레일)·1910.147(LOTO), KOSHA G-26(안전대)·산업안전보건법 §38, ISO 45001:6.1, NFPA 70E. GPT·Gemini는 법규 인용 0건이라, 감사 때 "이거 어디서 나온 답이에요?"에 답할 수 없습니다.

OSHA·KOSHA·ISO 16건 자동 인용
OSHA·KOSHA·ISO 16건 자동 인용

왜 이런 차이가 날까 — 학습 데이터

일반 LLM(GPT·Gemini)은 위키·뉴스·일반 문서 위주로 학습해 산업안전 도메인 비중이 매우 낮고, 한국 산업안전보건법·KOSHA 가이드는 거의 없습니다. 반면 산업안전 특화 AI는 270만+ 라벨링 사고사례와 안전법규·KOSHA 가이드를 높은 비중으로 학습하고, 위험 검출 시 치명도를 자동 산정하도록 훈련됐습니다.

결론: 분석이 아니라 소음
결론: 분석이 아니라 소음

정리

  • GPT 15개 / Gemini 5개 / 산업안전 AI 4개 — 개수는 의미 없습니다.
  • 산업안전 AI는 등급(P×S 매트릭스) + 사고사례 매칭 + 법규 인용 16건 + 체인 매핑까지 자동.
  • 필요한 건 "많이"가 아니라 "우선순위가 매겨진" 위험요인입니다.

사진 한 장으로 직접 비교해 보세요

Heinrich 무료로 시작하기 →