IT/AI

[Kanana-o] 멀티모달 정말 잘 될까? 7가지 입력 시나리오 테스트 결과 총정리

snapcoder 2026. 6. 5. 02:44
728x90
반응형
SMALL




멀티모달 검증

지난 3개월 간 Kanana-O API의 멀티모달 입력 기능을 체계적으로 검증했습니다.

텍스트만 입력하는 것부터 음성, 이미지를 함께 조합하는 방식까지 총 7가지 시나리오16개의 구체적인 테스트 케이스로 실행했습니다.

 

이 글에서는 각 시나리오별 실제 테스트 결과와 발견 사항을 정리합니다.

Kanana 공식 API 문서를 참고하면 더욱 자세한 기술 사양을 확인할 수 있습니다.

 

Kanana-o

더욱 똑똑하게 답하며, 더욱 풍부한 감정표현을 향한 Kanana-o의 진화 과정

omni.kanana.ai

API 공식 가이드 문서

 

kakaocorp/Kanana-1.5-o-9.8B-instruct-2602-API_Doc · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

huggingface.co

 



 

7가지 멀티모달 입력 시나리오 개요

시나리오 입력 방식 테스트 케이스 API 호출 특징
1️⃣ 텍스트만 텍스트 3개 streamChat 기본 입력 방식, 안정적
2️⃣ 이미지만 이미지 2개 streamChat 시각 정보 처리, 인식 능력 우수
3️⃣ 음성만 음성 2개 streamChatAudio 오디오 데이터 직접 처리
4️⃣ 텍스트+음성 텍스트, 음성 2개 streamChatAudio 음성 우선 처리
5️⃣ 텍스트+이미지 텍스트, 이미지 3개 streamChat 정보 통합 처리 효과적
6️⃣ 음성+이미지 음성, 이미지 2개 streamChatAudio 멀티모달 통합 능력 우수
7️⃣ 텍스트+음성+이미지 텍스트, 음성, 이미지 2개 streamChatAudio 최대 3개 입력 조합





 

 

테스트에 사용한 이미지 파일 3가지

이미지가 포함된 시나리오(2, 5, 6, 7)에서는 동일한 이미지 3장을 반복 활용해 일관된 비교가 가능하도록 했습니다.

 

이미지 A — 수식 (1+3 = ?)

흰 배경에 1+3 = ? 수식만 크게 표시한 단순한 이미지입니다.

이미지 내 수식 인식 및 계산 능력을 검증하는 데 사용했습니다.

텍스트 지시 없이 이미지만 전달했을 때도 AI가 수식을 자동 인식하고 계산 결과를 내놓는지를 확인했습니다.

 

이미지 B — 단체 사진 (카나나 429 앰배서더 밋업)

카나나 429 앰배서더 행사의 단체 사진입니다.

무대 앞에 수십 명이 도열해 포즈를 잡은 장면으로, 이미지 내 인물 수 카운팅 능력을 테스트하는 데 활용했습니다.

실제 밋업 사진을 사용해 현실적인 인물 인식 성능을 평가했습니다.

 

이미지 C — 텍스트 이미지 ("바나나" 이걸 거꾸로 읽어봐)

흰 배경에 "바나나" 이걸 거꾸로 읽어봐라는 문장이 텍스트로 표시된 이미지입니다.

이미지 내 한글 텍스트를 얼마나 정확히 인식하고 의미를 파악하는지 확인하는 데 사용했습니다.





 

 

 

 

시나리오 1️⃣ 텍스트만 입력하기

텍스트 입력은 가장 기본이 되는 방식입니다.

면접 조언, 논리 추론, 언어 이해 같은 다양한 종류의 질문을 처리하는지 확인했습니다.



API 호출 테스트 (1-A)

Kanana-O API의 기본 동작을 테스트했습니다. 카나나가 무엇인지를 한 줄로 설명해달라고 요청했을 때의 응답입니다.

사용자 입력: "카나나 인 카카오톡에 대해서 한줄로 간단히 설명해주세요."

AI 최종 응답: "카나나는 카카오가 만든 AI 비서로, 카카오톡 안에서 질문에 답하고 다양한 서비스를 쉽게 이용할 수 있게 도와줘요!"

테스트 결과: ✅ 정상 작동. API 호출 및 기본 응답 확인. 음성(TTS) 재생도 함께 제공됨.

 

논리 추론 능력 (1-B)

면접 상황을 가정한 함정 질문으로 AI의 상황 판단 능력을 테스트했습니다.

사용자 입력: "면접관이 '1+3은 몇입니까?' 라고 물어봤다. 뭔가 함정이 있는 걸까? 어떻게 대답해야 해?"

AI 최종 응답: "음... 이 질문은 사실 숫자 계산 문제라기보다는 지원자의 사고방식이나 당황했을 때 대처하는 태도를 보려는 의도가 많아요. 정답은 4죠. 그런데 면접관이 왜 이런 걸 물었는지 생각해볼 필요가 있어요. 혹시 지원자가 너무 긴장해서 엉뚱하게 답하는지, 아니면 농담처럼 받아들이는지, 혹은 논리적으로 차근차근 설명하는지 보고 싶었을 수도 있거든요. 그래서 이렇게 답해보세요. '네, 1 더하기 3은 4입니다. 혹시 다른 의미가 있다면 설명해주시면 좋겠습니다.' 이렇게 솔직하고 침착하게 말하면 충분히 좋은 인상을 줄 수 있어요."

테스트 결과: ✅ 정상 작동. 단순 계산을 넘어 면접 맥락에서의 의도까지 분석하고 실용적인 답변 전략을 제시.

 

언어 이해 (1-C)

한국어 말장난 문제로 언어 이해 능력을 확인했습니다.

사용자 입력: "바나나를 거꾸로 읽으면 뭐야? 그게 한국어에서 무슨 뜻이야?"

AI 최종 응답: "하하, 바나나를 거꾸로 읽으면 '아나나바'가 되죠. 한국어로는 특별한 의미가 있는 단어는 아니고, 그냥 재미있는 말장난이네요. 가끔 친구들끼리 장난칠 때 쓰기도 하고요. 의미를 찾으려고 하면 좀 웃긴 단어가 되네요."

테스트 결과: ✅ 정상 작동. 의도는 정확히 인식. 한국어 내 의미 없음도 올바르게 답변. 다만 "아나나바"(오답)가 출력되는 오류 발생.





 

 

 

 

 

 

시나리오 2️⃣ 이미지만 입력하기

이미지 단독 입력 방식을 테스트했습니다.

텍스트가 없이 오직 이미지 파일만 업로드했을 때 API가 이미지를 인식하고 분석하는 능력을 확인했습니다.



텍스트 이미지 인식 (2-A)

이미지 C("바나나" 이걸 거꾸로 읽어봐)를 텍스트 지시 없이 이미지만 업로드했습니다.

사용자 입력: 이미지 C만 전송 (텍스트 없음)

AI 최종 응답: '"바나나"를 거꾸로 읽으면 "아나나바"가 돼요. 한국어에서는 특별한 뜻은 없고, 그냥 재미있는 말놀이에요. 듣기만 해도 웃음이 나죠?'

테스트 결과: ✅ 정상 작동. 이미지 내 텍스트를 자동 인식하고, 지시대로 단어를 거꾸로 읽어 정답에 가까운 결과('아나나바')와 설명까지 제공. 다만 "아나나바"(오답)가 출력되는 오류 재발생.

 

수식 이미지 인식 (2-B)

이미지 A(1+3 = ?)를 텍스트 지시 없이 이미지만 업로드했습니다.

사용자 입력: 이미지 A만 전송 (텍스트 없음)

AI 최종 응답: "이 문제는 아주 간단해요! 1 더하기 3은 4죠. 그래서 정답은 4입니다. 헤헤, 너무 쉬웠죠?"

테스트 결과: ✅ 정상 작동. 이미지 내 수식을 정확히 인식하고 계산 결과를 자연스러운 구어체로 답변.





 

 

 

 

 

 

시나리오 3️⃣ 음성만 입력하기

음성 입력은 텍스트와 달리 오디오 데이터가 API에 직접 전송됩니다.

STT(음성 인식) 텍스트는 화면에만 표시되고 API 파라미터로 사용되지 않습니다.



음성 수학 계산 (3-A)

수학 계산 질문을 음성으로 입력했습니다.

사용자 입력: 음성 "아니 3의 제곱근은 얼마냐고" (녹음 길이 00:04)

AI 최종 응답: "오, 좋은 질문이에요! 음... 제가 실시간으로 계산해 드릴 수 없지만, 보통 3의 제곱근은 약 1.732 정도로 알려져 있어요. 혹시 더 정확한 값이 필요하시면 계산기 앱이나 온라인 계산기를 써보시는 것도 추천드려요!"

테스트 결과: ✅ 정상 작동. 음성으로 입력한 수학 질문을 정확히 인식하고 근삿값(√3 ≈ 1.732)과 함께 실용적인 조언 제공.

 

음성 일반 조언 (3-B)

취업 준비 관련 조언을 음성으로 질문했습니다.

사용자 입력: 음성 "신입 개발자 취업 준비할 때 가장 중요한게 뭐야" (녹음 길이 00:06)

AI 최종 응답: "신입 개발자라면 우선 기본기를 탄탄히 다지는 게 제일 중요해요! 언어 하나는 깊게 파고들고, 자료구조랑 알고리즘 개념을 확실히 익혀두세요. 그리고 작은 프로젝트라도 직접 만들어보면서 버전 관리랑 배포까지 경험해보면 좋아요. 또, 협업 툴이랑 코드 리뷰 문화에 익숙해지면 현장 적응이 훨씬 쉬워져요. 마지막으로, 문제를 끝까지 파고드는 끈기와 꾸준함이 진짜 큰 힘이 됩니다!"

테스트 결과: ✅ 정상 작동. 음성 입력으로도 체계적이고 실질적인 취업 조언을 길게 제공. 기본기·프로젝트 경험·협업 툴·끈기까지 4가지 핵심 포인트를 자연스럽게 짚어줌.





 

 

 

 

 

 

 

시나리오 4️⃣ 텍스트 + 음성 조합

텍스트와 음성을 함께 입력할 때, 음성이 우선됩니다. API는 streamChatAudio를 호출하여 오디오 데이터를 직접 처리합니다.



무관한 주제 조합 (4-A)

음성과 텍스트를 전혀 다른 주제로 동시에 입력해 우선순위를 확인했습니다.

사용자 입력: 음성 "바나나를 거꾸로 읽으면 뭐야" (00:05) + 텍스트 "수학"

AI 최종 응답: "바나나를 거꾸로 읽으면 음... 나나바가 돼요! 헤헤, 재밌죠?"

테스트 결과: ⚠️ 음성 우선 확인. 텍스트 "수학"은 완전히 무시되고 음성 내용만 처리됨.

 

보완적 조합 (4-B)

음성과 텍스트를 서로 보완되는 주제로 입력해 시너지 효과를 확인했습니다.

사용자 입력: 음성 "주제로 자주 나오는 질문이 뭐야" (00:06) + 텍스트 "취업 면접"

AI 최종 응답: "좋아요! 신입 개발자 면접에서 자주 나오는 질문 몇 가지 바로 드릴게요. 자기소개랑 지원 동기는 기본이고요, 본인이 가장 자신 있는 기술 스택이 뭔지, 그걸 어떻게 공부했는지 꼭 물어봐요. 최근에 해결한 어려운 문제가 뭐였는지, 팀 프로젝트에서 갈등이 생겼을 때 어떻게 풀었는지도 많이 물고요. 또, 앞으로 배우고 싶은 기술이나 관심 분야가 뭔지, 그리고 왜 우리 회사인지까지 준비하면 든든하죠!"

테스트 결과: ✅ 효과적. 음성("자주 나오는 질문")이 우선 처리되면서 텍스트("취업 면접")의 맥락이 자연스럽게 반영돼 더욱 구체적인 응답 생성.





 

 

 

 

 

시나리오 5️⃣ 텍스트 + 이미지 조합

텍스트와 이미지를 함께 입력하면 streamChat으로 처리되며, 두 정보가 함께 활용됩니다.



인물 카운팅 (5-A)

이미지 B(단체 사진)와 텍스트 질문을 함께 전달해 이미지 분석 능력을 확인했습니다.

사용자 입력: 이미지 B (단체 사진) + 텍스트 "이 이미지에 사람이 몇 명이야?"

AI 최종 응답: "음... 사진만으로 정확히 세긴 어렵다, 미안! 대략 80명 안팎처럼 보여. 더 정확히 알려면 원본 해상도랑 개별 인물 확인이 필요해."

테스트 결과: ✅ 정상 작동. 텍스트 질문과 이미지를 통합 처리하여 인물 수를 추정. 불확실성을 솔직하게 인정하는 점도 긍정적.

 

수식 계산 + 추가 연산 (5-B)

이미지 A(수식)와 함께 추가 계산 지시를 텍스트로 제공해 복합 처리를 테스트했습니다.

사용자 입력: 이미지 A (1+3=?) + 텍스트 "수식 계산해주고 최종 결과값에 2를 곱한게 답이니까 답을 구해줘"

AI 최종 응답: "좋아! 먼저 1 더하기 3은 4야. 여기에 2를 곱하면 8이지. 그래서 정답은 8이야! 짝짝!"

테스트 결과: ✅ 정상 작동. 이미지의 수식(1+3=4)을 인식하고, 텍스트의 추가 연산 지시(×2)까지 정확히 수행해 최종 답 8을 도출.

 

이미지 텍스트 인식 (5-C)

이미지 C(텍스트 이미지)와 함께 텍스트로 읽기 지시를 내렸습니다.

사용자 입력: 이미지 C ("바나나" 이걸 거꾸로 읽어봐) + 텍스트 "이 이미지를 읽어봐"

AI 최종 응답: '"바나나" 이걸 거꾸로 읽어봐!'

테스트 결과: ✅ 이미지 내 텍스트 인식. 다만 "읽어봐"라는 지시를 이미지 내용을 그대로 낭독하는 것으로 해석, 거꾸로 읽는 작업은 수행하지 않음. 텍스트와 이미지의 지시가 중복될 때 이미지 내용을 그대로 반환하는 특성 확인.





 

 

 

 

 

시나리오 6️⃣ 음성 + 이미지 조합

음성과 이미지를 함께 입력하면 streamChatAudio로 처리되며, 음성 오디오가 API 파라미터로 직접 전송됩니다.



음성 인물 카운팅 (6-A)

이미지 B(단체 사진)와 음성 질문을 함께 전달했습니다.

사용자 입력: 이미지 B (단체 사진) + 음성 "이미지에 사람이 몇 명이야" (00:04)

AI 최종 응답: "사진 속엔 대략 70명 정도 보여요! 다들 무대 앞에서 단체로 포즈 잡고 있네요. 와 분위기 좋다!"

테스트 결과: ✅ 정상 작동. 음성 질문과 이미지 정보를 효과적으로 통합. 인원 추정(70명) 외에 현장 분위기까지 자연스럽게 묘사. 5-A(텍스트+이미지, 80명 추정)와 약간 다른 수치를 제시한 점이 흥미롭습니다.

 

음성 이미지 텍스트 인식 (6-B)

이미지 C(텍스트 이미지)와 음성으로 내용 확인 질문을 함께 전달했습니다.

사용자 입력: 이미지 C ("바나나" 이걸 거꾸로 읽어봐) + 음성 "이 텍스트 뭐라고 쓰여 있어" (00:04)

AI 최종 응답: "이 문장은 '바나나'라는 단어를 거꾸로 읽어보자는 제안이에요. 그러니까 '바나나'를 뒤집어서 읽으라는 뜻이죠!"

테스트 결과: ✅ 정상 작동. 음성 질문의 의도("뭐라고 쓰여 있어")를 파악하고 이미지 내 문장의 내용과 의미까지 함께 설명.





 

 

 

 

 

시나리오 7️⃣ 모두 조합 (텍스트 + 음성 + 이미지)

세 가지 입력 방식을 모두 함께 사용합니다. 이 경우 음성이 최우선이며, streamChatAudio로 처리되어 오디오 데이터가 직접 API에 전송됩니다.



이미지 + 음성 + 창의적 텍스트 조합 (7-A)

이미지 C(바나나 텍스트), 음성으로 이미지 내용 질문, 텍스트로 창의적 시도 요청을 모두 동시에 전달했습니다.

사용자 입력: 이미지 C ("바나나" 이걸 거꾸로 읽어봐) + 음성 "이 글자 뭐야" (00:04) + 텍스트 "재미있는거 시도해봐"

AI 최종 응답: "좋아! 그럼 내가 바나나를 거꾸로 읽어볼게. 음... '나나바'! 하하, 느낌 오지?"

테스트 결과: ✅ 작동 확인. 세 가지 입력 중 음성("이 글자 뭐야")이 우선 처리되었고, 텍스트("재미있는거 시도해봐")의 맥락도 반영해 바나나를 직접 거꾸로 읽는 시도를 보여줌. 다만 여기서도 "나나바"(오답)가 출력되는 오류가 반복됨.

 

이미지 + 상충하는 음성·텍스트 지시 (7-B)

이미지의 수식을 기반으로, 음성과 텍스트에 서로 다른 추가 연산을 지시해 어느 쪽이 우선되는지 확인했습니다.

사용자 입력: 이미지 A (1+3=?) + 음성 "중간 결과값으로 6을 더 해야 돼" (00:06) + 텍스트 "최종 결과값으로 2를 곱한게 답이야"

AI 최종 응답: "오케이! 1 더하기 3은 4니까, 여기에 2를 곱하면 8이야. 정답은 8! 짝짝!"

테스트 결과: ⚠️ 텍스트 우선 관찰. 음성 지시("6을 더해야 돼")는 무시되고 텍스트 지시("2를 곱한게 답")가 따라진 결과가 출력됨. 음성이 항상 우선이 아니라, 이미지+텍스트 조합이 음성보다 강하게 작용하는 경우가 있음을 시사하는 흥미로운 결과.





 

 

멀티모달 검증 리뷰 - 핵심 포인트

음성 입력 우선순위가 가장 중요한 발견입니다.

음성이 포함되면 API는 항상 streamChatAudio를 호출하며, 오디오 데이터가 직접 처리됩니다.

 

화면에 표시되는 STT(음성 인식) 텍스트는 브라우저의 기본 음성 인식 모델을 사용한 것으로, AI 모델의 입력 파라미터로는 미사용됩니다. 오디오 데이터 자체가 API로 전송되어 처리되며, 화면의 STT 텍스트는 사용자 경험 개선 목적으로만 표시되도록 구현했습니다.

 

단, 7-B 테스트에서 확인한 것처럼 음성이 항상 100% 우선되는 것은 아닙니다.

이미지와 텍스트가 서로 맥락이 강하게 연결된 경우, 음성 지시보다 이미지+텍스트 조합이 우선 반영되는 결과가 나타났습니다.

 

이미지 인식 능력이 우수합니다.

텍스트 이미지, 수식, 인물 사진 등 다양한 종류의 이미지를 정확히 인식했으며, 사용자의 텍스트 또는 음성 질문과 함께 조합될 때 더욱 효과적으로 작동했습니다.

 

100% 완벽하지 않은 언어 처리 오류도 발견됐습니다.

"바나나를 거꾸로 읽으면?"이라는 질문에,

음성이 포함된 시나리오(4-A, 7-A)에서는 "나나바"라는 정답이 나왔지만,

텍스트 입력(1-C)과 이미지 입력(2-A)에서는 "아나나바"라는 오답이 반복 출력됐습니다.



 

 

마치며

3개월 동안 직접 구현하고 테스트하면서 느낀 건, Kanana-O API는 꽤 쓸 만하다는 것입니다.

텍스트·음성·이미지 세 가지 입력이 각각 잘 작동했고, 조합했을 때도 대부분 의도한 대로 반응했습니다.
특히 이미지 인식 능력은 기대 이상이었습니다. 수식을 그냥 읽어내는 수준을 넘어, 텍스트 질문과 결합해
추가 연산까지 수행하는 모습은 실제 서비스에 적용할 수 있겠다는 확신을 줬습니다.

물론 완벽하지 않습니다. 음성 경로에서 언어 처리가 아직 불안정한 경우가 있었고, 음성·텍스트·이미지를
동시에 쓸 때 우선순위가 예상과 다르게 동작하는 케이스도 있었습니다.

하지만 이런 결과들이 오히려 이 테스트를 의미 있게 만든다고 생각합니다. 잘 되는 것만 확인하는 게
아니라, 어떤 조합에서 어떻게 튀는지를 미리 파악해두는 것이 실제로 서비스를 만들 때 훨씬 중요한
정보인 것 같습니다.

앞으로도 Kanana가 점점 더 발전하면서 지속적으로 검증하고 사용해볼 계획입니다.

감사합니다.

 

 

 

728x90
반응형
LIST