"이 이미지 분석해줘"를 AI에 맡겨본 적 있으세요?
요즘 AI가 텍스트만 잘하는 게 아니에요. 사진을 보여주면 뭐가 찍혀 있는지, 문서를 읽어주고, 심지어 차트 데이터까지 추출해줘요.
그런데 GPT-4o, Gemini, Claude 중 뭘 써야 할지 모르겠다는 분이 많더라고요. 제가 직접 같은 이미지로 세 모델을 테스트해봤어요. AI 이미지 생성 도구도 함께 알아보고 싶다면 AI 이미지 생성 사이트 추천 7곳을 참고하세요.

2026년 AI 비전 모델 3대장
GPT-4o (OpenAI)
가장 범용적인 비전 모델이에요.
- 강점: 복잡한 이미지 이해, 한국어 OCR, 다중 이미지 비교
- 약점: 이미지 내 작은 텍스트 인식이 가끔 흔들려요
- 가격: ChatGPT Plus ($20/월) 또는 API ($0.01~0.03/이미지)
제가 영수증 사진을 올렸더니 품목, 가격, 합계까지 정확하게 표로 만들어줬어요. 실무에서 가장 쓸모 있는 순간이었어요.
Gemini 2.0 (Google)
구글의 멀티모달 AI예요. 특히 동영상 분석이 강력해요.
- 강점: 동영상 분석, 대용량 이미지 배치 처리, 무료 티어 넉넉
- 약점: 한국어 텍스트 인식이 GPT-4o보다 살짝 떨어져요
- 가격: 무료 플랜 제공, 유료 플랜 별도 (한도·요금은 공식 페이지에서 확인)
1시간짜리 유튜브 영상을 올리고 "5분마다 핵심 장면 캡처해줘"라고 했더니 진짜 해줘요. 이건 다른 모델에서 못하는 기능이에요.
Claude 3.5 Sonnet (Anthropic)
분석의 깊이가 다른 모델이에요.
- 강점: 차트/그래프 데이터 추출, 문서 레이아웃 이해, 세밀한 분석
- 약점: 동영상 미지원, 이미지 생성 불가
- 가격: 무료 (일 제한), Pro $20/월
재무제표 사진을 올렸을 때 Claude가 가장 정확했어요. 숫자 하나 안 틀리고 표로 정리해주더라고요.
실전 비교 테스트 결과
같은 이미지 5종으로 테스트한 결과예요. 정확도는 수치로 재기 어려워서 상대적인 인상으로 정리했어요.
테스트 1: 한국어 간판 사진
| 모델 | 정확도 | 특이사항 |
|---|
| GPT-4o | 높음 | 작은 글씨까지 읽음 |
| Gemini | 보통 | 일부 글자 누락 |
| Claude | 높음 | 글자 위치까지 설명 |
테스트 2: 엑셀 차트 캡처
| 모델 | 정확도 | 특이사항 |
|---|
| GPT-4o | 보통 | 범례 일부 오류 |
| Gemini | 보통 | 축 라벨 누락 |
| Claude | 높음 | 데이터 포인트까지 추출 |
테스트 3: 손글씨 메모
| 모델 | 정확도 | 특이사항 |
|---|
| GPT-4o | 보통 | 흘려쓴 글씨 인식 |
| Gemini | 제한적 | 단어 단위 인식 |
| Claude | 보통 | 문맥 추론으로 보완 |
세 모델 모두 손글씨에서는 눈에 띄게 흔들렸어요. 손으로 쓴 메모를 옮겨야 한다면 결과를 그대로 믿지 말고 원본과 한 번 대조하는 습관이 필요해요.
테스트 4: 제품 사진
| 모델 | 정확도 | 특이사항 |
|---|
| GPT-4o | 높음 | 브랜드, 모델명 식별 |
| Gemini | 높음 | 유사 제품 추천까지 |
| Claude | 보통 | 기능 설명에 집중 |
테스트 5: 건축 도면
| 모델 | 정확도 | 특이사항 |
|---|
| GPT-4o | 보통 | 기본 구조 설명 |
| Gemini | 보통 | 면적 추정 시도 |
| Claude | 높음 | 축척 기반 분석 |
용도별 추천 모델
결론적으로 용도에 따라 다른 모델을 쓰는 게 좋아요.
문서/OCR 작업 → GPT-4o
영수증, 명함, 계약서 등 텍스트가 많은 이미지는 GPT-4o가 최고예요. 한국어 인식률이 가장 높고, 표 형식으로 깔끔하게 정리해줘요.
동영상/대량 이미지 → Gemini
유튜브 분석, 제품 사진 100장 비교 같은 대량 작업은 Gemini가 압도적이에요. 무료 티어도 넉넉해서 비용 부담이 없어요.
데이터 분석/차트 → Claude
재무제표, 그래프, 기술 문서 같은 정밀 분석은 Claude가 가장 정확해요. 숫자 하나 안 틀리는 꼼꼼함이 장점이에요.
무료로 시작하는 꿀팁
세 모델 모두 무료 플랜이 있어요.
- ChatGPT 무료: 일 제한 있지만 이미지 분석 가능
- Gemini 무료: 무료 플랜에서도 이미지 분석 가능
- Claude 무료: 일 제한 있지만 분석 깊이가 좋음
일상적인 용도라면 무료만으로도 충분해요. 세 개 다 가입해두고 용도에 따라 골라 쓰는 게 가장 현명한 방법이에요. ChatGPT 데이터 분석 기능도 궁금하다면 ChatGPT 데이터 분석 기능 200% 활용법을 확인해보세요.
이럴 때 쓰면 확실히 편해요
막상 어디에 써야 할지 감이 안 온다는 분이 많아서, 실제로 손이 덜 가는 상황을 정리해봤어요.
영수증과 명세서 정리
출장비나 경비를 정산할 때 영수증을 한 장씩 옮겨 적는 게 제일 귀찮잖아요. 사진을 올리고 날짜, 상호, 금액만 표로 뽑아달라고 하면 옮겨 적는 시간이 크게 줄어요. 다만 합계는 마지막에 직접 더해서 확인하세요.
외국어 메뉴판과 안내문
해외에서 찍은 메뉴판이나 안내판을 올리면 읽어주는 동시에 번역까지 해줘요. 손으로 타이핑할 수 없는 글자를 다룰 때 특히 편합니다.
발표 자료에 들어갈 차트 읽기
남이 만든 자료의 그래프에서 수치를 다시 써야 할 때, 이미지를 올려 표로 정리해달라고 하면 눈으로 읽어가며 옮기는 것보다 빨라요. 축 라벨이 잘려 있으면 잘못 읽으니 원본을 옆에 두고 대조하세요.
화면 오류 메시지 설명 듣기
에러 창을 캡처해서 올리고 무슨 상황인지 물어보면 검색어를 뭘로 잡아야 할지 감이 잡혀요. 초보자에게 특히 쓸모 있는 활용법이에요.
손으로 쓴 회의 메모 정리
수첩에 적은 메모를 옮길 때 쓸 수 있지만, 앞서 봤듯 손글씨는 오류가 잦아요. 초안을 뽑는 용도로만 쓰고 반드시 원본과 맞춰보세요.
결과를 좌우하는 건 모델보다 사진 상태
모델을 바꾸는 것보다 올리는 이미지를 손보는 쪽이 효과가 큰 경우가 많아요.
- 정면에서 찍기: 비스듬히 찍은 문서는 글자가 겹쳐 보여서 인식률이 떨어져요
- 그림자 피하기: 손 그림자나 조명 반사가 글자 위에 걸리면 그 부분을 통째로 놓쳐요
- 필요한 부분만 잘라 올리기: 전체 페이지 대신 읽어야 할 표만 잘라 올리면 훨씬 정확해요
- 해상도 유지: 메신저로 여러 번 전달된 사진은 이미 압축돼서 작은 글씨가 뭉개져 있어요
- 한 장에 하나씩: 서로 다른 문서를 한 장에 몰아 찍으면 어느 값이 어디 것인지 섞여요
같은 영수증도 정면에서 다시 찍어 올리면 결과가 눈에 띄게 달라져요. 모델을 갈아타기 전에 사진부터 다시 찍어보세요.
물어보는 방식도 중요해요
"이 사진 분석해줘"처럼 두루뭉술하게 물으면 원하지 않는 설명만 길게 나와요. 무엇을 뽑아낼지 지정하는 편이 낫습니다.
- 원하는 형식을 지정하세요. "표로 정리해줘", "항목과 금액만 나열해줘"처럼요
- 읽지 못한 부분은 비워두라고 미리 말해두세요. 그래야 흐릿한 글자를 지어내는 걸 줄일 수 있어요
- 숫자가 중요한 자료라면 "원본에 없는 값은 추측하지 말라"고 못 박아두세요
- 여러 장을 비교할 때는 "장별로 나눠서 정리해줘"라고 요청해야 섞이지 않아요
한 번에 완벽한 답을 받으려 하기보다 두 번에 나눠 묻는 편이 정확해요. 먼저 "이 이미지에 보이는 것을 그대로 옮겨 적어줘"로 읽기만 시키고, 결과를 눈으로 확인한 다음 "이제 이걸 표로 정리해줘"라고 이어서 요청하는 식이죠. 읽기와 가공을 한꺼번에 시키면 잘못 읽은 값이 정리 과정에 묻혀서 눈에 안 띄거든요.
쓰기 전에 알아둘 주의점
- 숫자는 반드시 검산하세요: 표를 깔끔하게 만들어줘도 값 하나가 조용히 틀려 있을 수 있어요. 합계는 직접 확인하는 게 안전해요
- 개인정보가 담긴 이미지는 조심하세요: 신분증, 계좌 내역, 의료 기록은 업로드 전에 가릴 부분을 가리고 올리세요
- 회사 자료는 정책 확인 먼저: 사내 문서를 외부 AI에 올리는 게 금지된 곳도 많아요
- 진단·법률 판단에 쓰지 마세요: 설명은 그럴듯해도 책임질 수 있는 답이 아니에요
- 결과가 매번 같지 않아요: 같은 이미지를 다시 올려도 표현이나 세부 항목이 달라질 수 있으니, 중요한 작업이라면 한 번 더 돌려보고 비교하는 게 좋아요
- 모델은 계속 바뀝니다: 지금 잘 되던 작업이 업데이트 이후 달라지기도 하니, 오래 쓰는 업무라면 가끔 다시 확인해보세요
마무리: 직접 테스트해보세요
AI 비전 모델은 글로 읽는 것보다 직접 써보는 게 빨라요.
지금 핸드폰에 있는 아무 사진이나 하나 골라서 세 모델에 올려보세요. "이 사진에서 뭐가 보여?"라고 물어보면 각 모델의 차이를 체감할 수 있어요.