음성 텍스트 변환은 왜 이렇게 부정확할까? 원인과 해결법
음성 텍스트 변환은 왜 이렇게 부정확할까요? (음성 입력이라 부르든 음성 타이핑이라 부르든 같은 엔진, 같은 질문입니다.) 대체로 음성 인식이 마이크, 방, 목소리, 어휘, 모델로 이어진 사슬이고, 받아쓴 결과는 그 사슬에서 가장 약한 고리만큼만 좋기 때문입니다. “their”라고 말했는데 “there”가 나옵니다(영어에서 발음은 같고 뜻은 다른 두 단어입니다). 팀장님 성을 말했더니 채소 이름이 나옵니다. 생각하느라 잠깐 멈췄더니 말한 적도 없는 문장이 나타납니다.
증상마다 원인과 해결법이 다릅니다. 아래에서는 증상, 원인, 해결법 순으로 살펴본 뒤, 음성 텍스트 변환이 AI에 해당하는지 솔직하게 답합니다. 도구를 고르는 중이라면 받아쓰기 소프트웨어 비교부터 보세요.
음성 텍스트 변환이 틀리는 이유는 몇 가지뿐이고, 예측할 수 있습니다
음성 텍스트 변환이 단어를 틀리는 경우는 오디오가 불분명할 때, 모델이 학습 중에 거의 접하지 못한 단어일 때, 또는 발음이 비슷한 단어 중에서 고를 맥락이 부족할 때입니다. 대부분의 불만은 이 셋 중 하나로 거슬러 올라가며, 대개 증상을 보면 어느 쪽인지 알 수 있습니다.
| 보이는 증상 | 가능성 높은 원인 | 먼저 해 볼 것 |
|---|---|---|
| 여기저기 단어가 틀리고, 어떤 방에서는 더 심함 | 마이크가 너무 멀거나, 방이 울리거나 시끄러움 | 마이크를 입에서 손바닥 너비 안으로 가져오고, 어떤 마이크가 선택돼 있는지 확인 |
| 책상에서는 괜찮은데 밖에서는 엉망 | 바람과 차 소리가 휴대폰 마이크에 그대로 들어감 | 휴대폰을 손으로 감싸거나, 줄에 마이크가 달린 이어폰 사용 |
| 이름, 브랜드, 약어가 늘 틀림 | 모델이 거의 본 적 없는 단어 | 사용자 사전을 쓰거나 음성으로 수정 |
| “their” 대신 “there”, “to” 대신 “two” | 발음이 같은 단어는 맥락으로 결정됨 | 구절 단위로 통째로 말하고, 이런 단어를 일부러 골라 교정 |
| 첫 한두 단어가 빠짐 | 듣기 시작하기 전에 말함 | 듣고 있다는 신호를 기다림 |
| 긴 침묵 뒤에 말하지 않은 구절이 나옴 | 모델이 침묵을 채우고 있음 | 생각하는 동안에는 마이크를 멈춤 |
| 알아볼 수 없는 문자열, 또는 엉뚱한 언어 | 받아쓰기 언어나 지역 설정이 틀림 | 언어와 가장 가까운 지역 변형을 설정 |
| 갑자기 나빠짐 | 사슬 속 무언가가 바뀜 | 거슬러 확인: 새 이어폰, 업데이트, 새 키보드, 오프라인 언어 팩 |
모델보다 마이크가 더 중요합니다
음성 텍스트 변환이 엉망일 때 가장 먼저 배제해야 할 것은 나쁜 오디오입니다. 입에서 먼 마이크는 목소리만큼이나 크게 방 소리를 녹음하고, 애초에 또렷하게 도착하지 않은 단어는 어떤 모델도 되살릴 수 없습니다. 노트북 마이크는 팬과 키보드 바로 옆에 붙어 있습니다. 번잡한 거리에서 팔을 쭉 뻗어 휴대폰을 들고 있으면 녹음되는 건 대부분 거리 소리입니다.
헤드셋이라고 자동으로 나은 것도 아닙니다. 많은 블루투스 이어폰은 마이크가 켜져 있는 동안 음질이 낮은 통화 모드로 떨어지기 때문에, 싼 유선 이어폰이 비싼 무선 이어폰보다 나을 수 있습니다. 그리고 컴퓨터가 무엇을 듣고 있는지도 확인하세요. Mac 받아쓰기, Windows 음성 입력, Word의 Dictate(받아쓰기)는 모두 마이크를 고를 수 있고, 방 건너편에 있는 웹캠 마이크가 슬그머니 기본값이 되어 있을 수 있습니다.
업체들도 같은 말을 합니다. Microsoft의 Word Dictate 문제 해결 안내는 헤드셋이나 외장 마이크를 쓰고 배경 소음을 줄이라고 권하고, Google의 음성 입력 도움말은 조용한 곳으로 옮기고 외장 마이크를 연결하라고 합니다.
소프트웨어가 듣는 소리를 들어 보세요: 평소 받아쓰기하는 바로 그 자리에서 휴대폰 음성 메모 앱으로 20초를 녹음한 뒤 헤드폰으로 다시 들어 보세요. 식기세척기, 주방 환풍기, 자기 키보드 소리가 들린다면 인식 엔진에도 들립니다. 이럴 땐 앱을 바꾸는 것보다 마이크를 옮기는 편이 훨씬 효과적입니다.
어떻게 말하느냐가 무엇을 듣느냐를 바꿉니다
말하는 방식이 정확도에 영향을 주는 이유는 인식 엔진이 주로 자연스럽고 유창한 말에서 배우기 때문입니다. 말끝을 흐리거나, 문장 끝을 삼키거나, 한 단어씩 천천히 끊어 받아쓰면 모델이 활용할 정보가 줄어듭니다. “더 신중하게 말하라”는 Microsoft의 조언은 신중함이 느림이 아니라 완결성을 뜻할 때 맞는 말입니다. 문장을 머릿속에서 끝까지 생각한 다음, 한 호흡에 말하세요.
긴 침묵에는 더 이상한 위험도 있습니다. 2024년 “Careless Whisper”라는 제목의 연구에서 Allison Koenecke와 동료들은 OpenAI Whisper가 만든 전사본의 약 1%에 오디오에 없던 구절이나 문장이 통째로 들어 있었고, 이런 환각이 침묵 구간이 긴 화자에게서 유독 많이 나타났다는 사실을 발견했습니다. 대부분의 받아쓰기 도구가 바로 그 모델로 만들어진 것은 아니지만, 교훈은 그대로 적용됩니다.
생각은 마이크를 끄고: 다음 문장을 떠올리는 데 몇 초 이상 걸릴 것 같으면 받아쓰기를 멈추고 생각한 뒤, 문장 전체가 준비되면 다시 시작하세요. 어정쩡하게 끊긴 구절이 줄어들고, 엔진이 채워야 할 긴 침묵도 생기지 않습니다.
이름, 전문 용어, 동음이의어에는 엔진에 없는 맥락이 필요합니다
음성 텍스트 변환이 이름과 전문 용어에 약한 이유는 인식 엔진이 학습 중에 자주 접한 단어 쪽으로 기울기 때문입니다. 또 “their”와 “there”처럼 발음이 같은 영어 단어 중에서 고를 때는 맥락에 기대는데, 그 맥락이 없는 경우가 많습니다. 휴대폰 키보드가 듣는 건 따로 떨어진 한 문장뿐입니다. 당신이 Aoife에게 Q3 계약 갱신 건으로 답장하고 있다는 걸 모르니, 그 소리에 맞는 가장 흔한 단어를 집어 듭니다.
드문 단어라면 도구에 당신의 어휘를 넘겨주세요. 전용 AI 받아쓰기 앱에는 사용자 사전이 있고, Laxis Voice Keyboard는 이를 Personal Dictionary라고 부르며 이름, 약어, 기술 용어를 등록할 수 있게 합니다. 기본 내장 받아쓰기에는 대개 이런 기능이 없으니 그 자리에서 고치세요. Mac에서는 파란 밑줄이 그어진 단어를 클릭하면 대안이 나오고, iPhone에서는 “change”라고 말한 뒤 고칠 철자를 불러 주면 되며, Pixel에서는 잘못 들은 단어를 탭하면 됩니다. Google은 Pixel의 고급 음성 입력이 사용자가 고친 단어를 바탕으로 개선된다고 설명합니다.
동음이의어에는 다른 습관이 필요합니다. 구절이 길수록 모델의 언어 쪽이 참고할 정보가 많아지므로, “their” 한 단어만 말하는 것보다 “send it to their office”라고 말하는 편이 결과가 좋습니다. 그런 다음 동음이의어, 숫자, 부정어를 일부러 골라 교정하세요. 단어 하나만 틀려도 뜻이 뒤집히는 세 군데입니다.
억양과 방언은 공평하게 대우받지 못합니다
일부 억양과 방언에서는 음성 텍스트 변환의 정확도가 측정 가능할 만큼 낮습니다. 대부분의 엔진을 떠받치는 학습 데이터가 특정 말하기 방식을 지나치게 많이 담고 있기 때문입니다. 가장 잘 알려진 근거는 Allison Koenecke가 이끈 2020년 스탠퍼드 연구로, PNAS에 실렸습니다. 2019년에 테스트한 Amazon, Apple, Google, IBM, Microsoft의 시스템은 흑인 화자의 단어를 평균 35% 잘못 인식한 반면, 백인 화자는 19%였습니다. 이후 엔진들은 개선됐지만, 그 격차가 해소됐다고 입증한 사람은 아무도 없습니다.
자신이 말하는 방식과 가장 가까운 지역 변형을 고르면 도움이 되고, 비용도 들지 않습니다. 더 자세한 내용은 억양이 있거나 두 언어로 받아쓰기하는 법 가이드에서 다룹니다.
휴대폰 키보드는 작은 모델, 클라우드는 큰 모델을 돌립니다
휴대폰 받아쓰기는 대개 기기 자체에서 실행되며, 음성 모델은 휴대폰의 메모리와 배터리 한도 안에 들어가야 합니다. 반면 클라우드 서비스는 훨씬 큰 모델을 돌릴 수 있습니다. Apple에 따르면 iPhone 받아쓰기는 여러 언어에서 기기 안에서 처리되며 인터넷 연결이 필요 없습니다. Google에 따르면 Pixel의 고급 음성 입력은 Fix it 같은 기능을 쓰지 않는 한 말한 내용을 휴대폰 안에 둡니다. 이와 달리 Windows 음성 입력은 Microsoft의 Azure Speech 서비스 기반 온라인 인식을 사용합니다.
온디바이스라고 해서 원래 더 나쁜 건 아닙니다. 개인정보가 보호되고, 비행기에서도 작동하며, 휴대폰 제조사들은 결과를 다듬기 위해 로컬 언어 모델을 더하고 있습니다. iOS 27에서 Apple은 iPhone 17 Pro, iPhone Air 및 이후 모델에서 이런 모델을 사용해 영어의 철자, 문장 부호, 대문자 표기를 개선합니다. 하지만 이는 트레이드오프이고, 같은 문장이 휴대폰과 노트북에서 다르게 나오는 이유 중 하나입니다. 개인정보 측면은 온디바이스와 클라우드 전사 비교 해설에서 다룹니다.
음성 텍스트 변환이 점점 나빠지는 것 같다면, 기술이 퇴보했을 가능성은 낮습니다. 새 이어폰, 새 기본 키보드, OS 업데이트, 오프라인 언어 팩처럼 당신의 사슬 속 무언가가 바뀐 것입니다. 조용한 방에서 마이크 가까이 대고 다시 테스트해, 문제가 오디오를 따라가는지 소프트웨어를 따라가는지 확인하세요.
음성 텍스트 변환은 AI일까?
음성 텍스트 변환은 머신러닝이라는 의미에서 AI입니다. 현대 음성 인식 엔진은 사람이 직접 쓴 규칙의 모음이 아니라, 대량의 녹음 음성과 그에 짝지어진 전사본으로 학습한 신경망입니다. 그러니 네, AI에 해당합니다. Alec Radford와 동료들이 2022년 논문에서 소개한 OpenAI의 Whisper는 웹에서 수집한 680,000시간 분량의 오디오로 학습했습니다. 오늘날 주류 받아쓰기 엔진은 모두 이런 방식으로 만들어집니다.
위에서 본 동작 대부분이 이것으로 설명됩니다. 모델은 배운 것을 바탕으로 들은 소리에 가장 그럴듯한 단어를 예측하므로, 흔한 말에는 강하고 드문 이름이나 학습 데이터에 적게 반영된 목소리에는 약합니다. 확신에 차서 틀릴 수도 있고, 가끔은 아무도 말하지 않은 단어를 만들어 내기도 합니다. 인식 엔진이 어떻게 작동하는지는 음성 텍스트 변환 해설에서 더 깊이 다룹니다.
그렇다고 받아쓰기가 대신 글을 써 준다는 뜻은 아닙니다. 기본 음성 텍스트 변환은 받아쓸 뿐, 챗봇이라는 의미의 생성형 AI가 아닙니다. 다만 그 경계는 흐려지고 있습니다. 많은 도구가 언어 모델로 사용자의 말을 편집하는 두 번째 단계를 더하기 때문입니다. Windows의 Fluid dictation, Pixel의 Fix it, Apple의 iOS 27 모델, Laxis의 Verbal Cleanup이 모두 저마다의 방식으로 이 일을 합니다. 학교나 회사 정책이 “AI”를 제한한다면, 그게 전사를 뜻하는지 다시 쓰기를 뜻하는지 물어본 다음 어떤 부가 기능이 켜져 있는지 확인하세요.
기본 내장 받아쓰기로 충분할 때
조용한 방에서 짧은 메시지, 검색, 간단한 메모를 할 때는 기본 내장 받아쓰기로 충분하고, 무료이기도 합니다. 먼저 마이크, 언어 설정, 멈춤부터 고치세요. 그러고도 남는 문제가 주로 이름, 군더더기 말, 장황한 문장이라면 AI 받아쓰기 앱이 제값을 합니다.
Laxis Voice Keyboard는 데스크톱과 휴대폰 앱 전반에서 작동하고, 군더더기 말과 반복을 없애고, 문장 부호를 넣고, 이름에는 Personal Dictionary를 사용합니다. 한계도 있습니다. 클라우드 전용이라 연결이 필요하고 오디오가 기기 밖으로 나가며, 무료 플랜에서는 받아쓰기와 회의가 매달 300분의 공용 한도를 함께 씁니다. 14일 Premium 체험은 신용카드가 필요 없으니, 자신이 가장 골치 아팠던 오류로 직접 시험해 보세요.
자주 묻는 질문
iPhone에서 음성 텍스트 변환이 왜 이렇게 부정확한가요?
iPhone의 음성 텍스트 변환이 틀리는 이유는 iPhone만의 결함이라기보다 대개 마이크 거리, 배경 소음, 또는 한 번도 배운 적 없는 이름과 전문 용어 때문입니다. 휴대폰을 더 가까이 들고, 완결된 구절로 받아쓰고, 어려운 이름은 한 글자씩 철자를 불러 주세요. 미국 영어를 쓰는 iPhone 12 이후 모델에서는 “change”라고 말해 잘못 들은 단어를 음성으로 고칠 수도 있습니다.
음성 텍스트 변환이 왜 점점 나빠지나요?
음성 텍스트 변환이 나빠진 것처럼 느껴지는 건 대개 기술이 퇴보해서가 아니라 사용 환경에서 무언가가 바뀌었기 때문입니다. 흔한 원인은 새 블루투스 이어폰, 달라진 기본 마이크, 운영체제 업데이트, 새 키보드 앱, 오프라인 언어 팩입니다. 조용한 방에서 마이크를 가까이 두고 다시 테스트해, 문제가 오디오를 따라가는지 소프트웨어를 따라가는지 확인하세요.
음성 텍스트 변환은 AI인가요?
네. 현대 음성 텍스트 변환은 머신러닝을 사용합니다. 대량의 녹음 음성과 그에 맞는 전사본으로 학습한 신경망이, 들은 소리에 가장 그럴듯한 단어를 예측합니다. 예를 들어 OpenAI의 Whisper는 680,000시간 분량의 오디오로 학습했습니다. 순수한 받아쓰기는 글을 짓는 게 아니라 받아쓰는 것이지만, 이제 많은 도구가 텍스트를 다듬거나 다시 쓰는 AI 단계를 추가합니다.
음성 인식은 생성형 AI인가요?
기본 음성 인식은 챗봇이라는 의미의 생성형 AI가 아닙니다. 새로운 콘텐츠를 만드는 게 아니라 말한 내용을 받아쓰기 때문입니다. 하지만 경계는 흐려지고 있습니다. 인식 엔진은 텍스트를 단어 하나씩 만들어 내며 아무도 말하지 않은 구절을 가끔 끼워 넣을 수 있고, 많은 받아쓰기 도구는 사용자의 말을 다시 쓰는 언어 모델을 더합니다. 정책상 생성형 AI가 제한된다면 어떤 기능이 켜져 있는지 확인하세요.
음성 텍스트 변환을 더 정확하게 하려면 어떻게 해야 하나요?
마이크를 입에 더 가까이 두고, 배경 소음을 줄이고, 보통 속도로 완결된 구절을 말하고, 올바른 언어와 지역 변형을 고르세요. 그런 다음 도구에 당신의 어휘를 가르치고, 사용자 사전이 있다면 활용하세요. 이 단계들로 대부분의 오류가 해결됩니다. 그래도 이름과 군더더기 말이 문제라면 전용 AI 받아쓰기 앱을 써 보세요.
음성 텍스트 변환은 왜 이름을 틀리나요?
음성 텍스트 변환이 이름을 틀리는 이유는 인식 엔진이 학습 중에 자주 본 단어를 선호하는데, 대부분의 성, 브랜드, 약어는 드물기 때문입니다. 맥락이 없으면 엔진은 가장 가까운 흔한 단어로 대체합니다. 사용자 사전이 있는 도구라면 이름을 추가하면 해결됩니다. 기본 내장 받아쓰기에는 대개 이 기능이 없지만, iPhone과 최신 Pixel에서는 이름을 한 글자씩 철자로 불러 주면 통합니다.