음성 텍스트 변환: 작동 원리와 비용 정리
휴대폰에 한 문장을 말하고 단어가 나타나는 것을 지켜보세요. 그리고 다섯 번째 단어를 끝낸 뒤에 세 번째 단어가 바뀌는 것을 보세요. 그 깜빡임이 이 분야 전체를 축소해 놓은 장면입니다. 기계가 먼저 판돈을 걸고, 증거가 더 도착하면 걸었던 판돈을 고쳐 놓는 것이죠.
음성 텍스트 변환은 이제 너무 흔해져서 그것이 무엇인지 궁금해하는 사람이 거의 없습니다. 영상에 자막을 달고, 보험금을 청구하고, 자동응답 메뉴에 답하고, 진료 기록을 쓰고, 자동차 마이크가 듣는 것을 조용히 기록합니다. 실패하는 방식도 마찬가지여서, 그 구조를 이해하기 전까지는 무작위처럼 보이지만 이해하고 나면 거의 필연으로 보입니다.
그래서 정리합니다. 이 용어가 무엇을 포괄하는지, 당신의 입과 화면 사이에서 시스템이 무엇을 하는지, 솔직히 얼마나 정확한지, 누가 여기에 기대고 있는지, 비용은 얼마인지, 그리고 최근에 무엇이 바뀌었는지. 제품 순위는 여기에 없습니다.
이 용어가 덮는 범위는 대부분이 생각하는 것보다 넓다
음성 텍스트 변환은 말한 오디오를 글로 옮기는 일입니다. 정식 명칭은 자동 음성 인식, 줄여서 ASR이고, 두 표현은 정확히 같은 것을 가리킵니다. 엔지니어와 벤더는 ASR이라고 하고, 나머지 사람들은 습관에 따라 음성 텍스트 변환 또는 받아쓰기라고 부릅니다.
사람들이 어긋나는 지점은 이것을 제품 카테고리로 취급할 때입니다. 카테고리가 아닙니다. 수많은 제품 아래에 깔려 있는 하나의 능력이고, 감각이 전혀 다른 두 가지 모드로 존재합니다.
실시간 모드: 소리가 아직 들어오는 동안에 돌아갑니다. 단어는 말하는 사람보다 몇 분의 1초 뒤처져 화면에 내려앉습니다. 받아쓰기 앱, 자막 시스템, 검색창의 마이크 버튼이 여기에 속합니다. 먼저 저장되는 것은 없고, 오디오는 도착하는 대로 소비됩니다.
파일 모드: 이미 존재하는 녹음 위에서 돌아갑니다. 전체가 한꺼번에 주어지므로, 시스템은 어떤 단어를 확정하기 전에 앞뒤를 모두 읽어 볼 수 있습니다. 회의나 인터뷰가 끝난 뒤 녹음을 하나의 문서로 바꾸는 일이 바로 이 모드이며, 이는 관련은 있지만 고유한 작업 흐름을 가진 별개의 일입니다.
서로 계속 헷갈리는 네 가지 기술
음성 텍스트 변환 검색 결과는 실제로는 전혀 다른 일을 하는 세 가지 인접 기술로 오염되어 있습니다. 한 번쯤 제대로 갈라 둘 가치가 있습니다.
가장 성가신 혼동은 화자 인식입니다. 느슨하게 쓰면 음성 인식과 같은 뜻입니다. 엄밀하게 쓰면 문제의 반대쪽 절반, 즉 무엇을 말했는지가 아니라 누가 말했는지를 가리킵니다. 성문 시스템은 말하는 사람 목소리의 물리적 특징을 등록된 샘플과 대조해 신원을 확인합니다. 은행이 "제 목소리가 제 비밀번호입니다"라고 말할 때 하는 일이 이것입니다. 화자 식별과 화자 분리도 같은 집안에서 나왔습니다. 이들이 알려 주는 것은 사람이지 단어가 아니며, 별도로 돌아갑니다. 전사본이 모든 단어의 철자를 맞히면서도 화자를 잘못 붙일 수 있는 이유가 바로 이것입니다.
| 기술 | 답하는 질문 | 입력 → 출력 | 마주치는 곳 |
|---|---|---|---|
| 음성 텍스트 변환(ASR) | 어떤 단어가 발화되었는가? | 오디오 → 텍스트 | 받아쓰기, 자막, 회의 전사본, 전화 메뉴 |
| 화자 인식 / 성문 인식 | 지금 말하는 사람은 누구인가? | 오디오 → 신원 또는 라벨 | 음성 뱅킹, "화자 2" 라벨, 법과학적 대조 |
| 텍스트 음성 변환(TTS) | 이 텍스트는 어떻게 들려야 하는가? | 텍스트 → 오디오 | 스크린 리더, 오디오북, 어시스턴트 응답, ARS 안내 |
| 구어 이해 | 무엇을 뜻했고 무엇을 해야 하는가? | 텍스트(또는 오디오) → 의도와 동작 | "타이머 맞춰줘", 콜 라우팅, 상담원 코파일럿 |
텍스트 음성 변환은 깔끔한 거울상입니다. 목소리에서 글을 만드는 대신 글에서 목소리를 만듭니다. 이해는 인식 위에 얹힙니다. 단어를 손에 넣은 뒤에도 "그거 다음 주 목요일로 미뤄줘"가 일정 요청이라는 판단을 내릴 무언가가 여전히 필요합니다. 스마트 스피커는 넷 중 셋을 1초도 안 되어 이어 붙이고, 그래서 사람들은 그것을 하나의 물건으로 경험합니다.
당신이 말하는 동안 기계가 하는 일
직관적인 모델, 즉 컴퓨터가 각 소리를 사전 속 단어에 맞춰 본다는 그림은 틀렸고, 결과를 개선하기 위해 할 수 있는 모든 쓸모 있는 일은 그것이 왜 틀렸는지에서 나옵니다.
인식기는 단어를 하나씩 짚어 나가지 않습니다. 받아들인 소리를 만들어 냈을 가능성이 가장 높은 단어 배열을 탐색하고, 후보를 두 가지 기준으로 동시에 채점합니다. 각 후보가 음향적 증거에 얼마나 들어맞는가, 그리고 언어의 한 조각으로서 얼마나 그럴듯한가. 고전적인 시스템은 이를 별도의 부품으로 나눠 두었습니다. 소리를 음소로 옮기는 음향 모델, 발음 사전, 그리고 단어 배열에 점수를 매기는 언어 모델입니다. 현대의 종단간 시스템은 사슬 전체를 하나의 신경망으로 학습시켜 텍스트 토큰을 곧바로 내놓지만, 밑바닥의 산수는 여전히 같은 줄다리기입니다.
이 줄다리기가 이 분야에서 가장 유명한 농담을 설명합니다. 영어의 "recognize speech"와 "wreck a nice beach"는 소리로는 거의 똑같습니다. 균형을 깨뜨릴 수 있는 것은 언어 쪽뿐이고, 그것이 균형을 깨는 방식은 사람들이 실제로 어느 쪽을 말하는지 묻는 것입니다. 이 논리를 조금 더 밀고 나가면 누구나 알아채는 그 동작이 나옵니다. 당신이 웅얼거린 단어를, 그 이웃들이 답을 뻔하게 만들어 준 덕분에 시스템이 대신 고쳐 놓는 것이죠.
같은 논리가 사람들을 가장 짜증나게 하는 실패도 설명합니다. 동료의 성이나 모델이 학습 중에 한 번도 만난 적 없는 사내 제품명을 말해 보세요. 시스템은 그것을 출력할 수 없습니다. "안 하는" 것이 아니라 못 하는 것입니다. 자기가 아는 것 중 가장 비슷한 것으로 바꿔 놓고 지나갑니다. 해법은 문맥 바이어싱, 즉 커스텀 사전, 커스텀 어휘, 워드 부스트라는 이름으로 팔리는 기능입니다. 짧은 용어 목록을 건네주면 시스템이 그쪽으로 탐색 가중치를 옮깁니다. 대부분의 도구에서 지렛대가 가장 큰 설정이자, 사람들이 가장 늦게 발견하는 설정입니다.
도구에 대한 평가를 바꿔 놓는 10분짜리 설정: 어떤 음성 텍스트 변환 앱이든 판단하기 전에, 커스텀 어휘에 스무 개 정도의 용어를 넣어 보세요. 동료들의 성, 제품명, 업계 약어, 가장 큰 고객사 두 곳. 대부분은 첫날에 평가하고, 이름이 세 번 망가지는 것을 보고, 이 기술은 별로라고 결론 내립니다. 별로가 아닙니다. 아직 당신의 세계를 만나지 못했을 뿐입니다.
실시간과 사후 처리는 다른 문제다
여기서 두 모드가 갈라지고, 품질을 둘러싼 혼란도 대부분 여기서 시작됩니다. 완성된 파일을 다루는 시스템은 앞을 볼 수 있습니다. 문장의 시작을 정하기 전에 문장의 끝을 이미 보고 있으니, 이것은 상당한 이점입니다. 같은 음향적 모호함도 미래 문맥이 3초만 있으면 훨씬 쉽게 풀립니다. 그래서 녹음을 처리하는 쪽이 같은 오디오를 실시간으로 잡아내는 쪽보다 대체로 낫습니다. 품질이 다른 제품이 아니라, 난이도가 다른 문제입니다.
실시간 시스템에는 참고할 미래가 없습니다. 지금 무언가를 내놓아야 하므로 부분 가설, 즉 현재 시점의 최선의 추측을 발표하고, 오디오가 더 도착하면 고칩니다. 그 수정이 바로 화면 위에서 스스로를 고쳐 쓰는 단어들입니다. 결함이 아니라, 자기 판돈을 갱신하는 시스템의 정직한 표현입니다.
실시간 음성 텍스트 변환의 사용감을 결정하는 메커니즘은 두 가지입니다.
- 엔드포인팅. 당신이 그저 잠깐 쉰 것인지 정말로 말을 끝낸 것인지 무언가가 판단해야 합니다. 임계값이 짧으면 시스템이 생각 도중에 당신을 끊고, 임계값이 길면 문장마다 어색한 기다림으로 끝납니다. 모두를 만족시키는 설정은 없고, 그래서 어떤 도구는 성급하게 느껴지고 어떤 도구는 굼떠 보입니다.
- 두 단계 디코딩. 흔한 구조는 이미 벌어진 것만 보는 빠른 모델을 돌려 깜빡이는 부분 결과를 만들고, 그다음 앞을 볼 수 있는 느린 모델이 그 줄을 확정합니다. 반응성이 필요한 곳에는 낮은 지연을, 텍스트가 영구히 남는 곳에는 더 높은 정확도를 배치하는 셈입니다.
여기서 지연도 하나의 숫자가 아닙니다. 첫 단어가 나타나기까지의 지연, 부분 결과가 갱신되는 속도, 한 줄이 확정되기까지의 기다림이 각각 있습니다. 청크 크기는 주로 첫 번째를 움직이고, 엔드포인팅은 주로 마지막을 움직입니다. 하나의 수치만 제시하는 벤더는 자기에게 유리한 수치를 제시하는 것입니다.
정확도는 제품이 아니라 당신 오디오의 속성이다
모두가 숫자 하나를 원합니다. 정직한 답에는 두 문장이 필요합니다.
연구자들은 이런 시스템을 단어 오류율(WER)로 채점합니다. 바뀐 단어, 빠진 단어, 없던 단어를 모두 더한 뒤 실제로 발화된 단어 수로 나눕니다. 낮을수록 좋고, 마케팅 문구에 실리는 정확도 퍼센트의 반대편입니다. 단어 오류율 3%는 정확도 97%입니다.
한 사람이 깨끗하게, 잘 녹음된 음성이라면 2026년 선두 엔진들은 대략 2~5% 구간에 놓입니다. ElevenLabs의 Scribe v2는 2026년 3월에 약 2.3%로 측정되었고, Deepgram의 Nova-3와 NVIDIA의 Canary Qwen은 독립 영어 리더보드에서 둘 다 5% 근처에 안착했습니다. 훌륭한 숫자이고, 대부분의 독자에게는 상관없는 숫자입니다.
벤치마크는 얌전한 녹음으로 만들어집니다. 읽은 문장, 괜찮은 마이크, 한 번에 한 목소리. 당신의 오디오는 노트북 스피커로 참여한 사람과 개 한 마리, 그리고 서로의 문장을 가로채는 두 사람이 있는 화상 회의입니다. 뒤섞인 현실 자료 전반에서는 공개된 정확도 수치가 약 85%에서 98%까지 벌어지고, 여러 사람이 어지럽게 말하는 회의 오디오의 오류율은 흔히 15~25% 구간으로 보고됩니다. 같은 엔진, 다른 세계입니다.
당신의 숫자를 움직이는 요인을 대략 피해가 큰 순서로 늘어놓으면 이렇습니다. 몇 사람이 동시에 말하는가, 마이크가 입에서 얼마나 떨어져 있는가, 방이 얼마나 울리는가, 말하는 사람의 억양이 학습 데이터에 얼마나 반영되어 있는가, 어휘가 얼마나 전문적인가. 억양 격차는 실재하고 업계 전체의 문제입니다. 오늘 팔리는 모든 엔진은, 우리 것을 포함해, 억양이 강하고 사람들이 서로 말을 겹칠 때 성능을 잃습니다. 그렇지 않은 척 암시하는 벤더는 영업 중입니다.
더 미묘한 문제도 있습니다. 시스템은 자기가 언제 틀렸는지 전혀 모릅니다. 신뢰도 점수는 존재하지만, 유창한 종단간 모델은 아무도 말하지 않은 문법적으로 완벽한 문장을 만들어 내고, 그것을 맞는 문장과 똑같이 태연하게 내놓을 수 있습니다. 사람 속기사는 "[알아들을 수 없음]"이라고 씁니다. 모델은 찍습니다.
살 수 있는 가장 값싼 정확도 개선책: $60짜리 USB 마이크나 유선 헤드셋이 벤더를 바꾸는 것보다 결과를 더 많이 개선합니다. 입 가까이에서 수음하면 방의 울림이 깎이고, 목소리가 배경 소음 위로 올라오며, 비슷한 자음을 갈라 주는 고역이 보존됩니다. 여기 나온 모든 모델은 똑같은 물리와 싸우고 있고, 그 물리는 소프트웨어 차례가 오기 전에 이미 결판이 납니다.
음성 텍스트 변환이 하루 종일 조용히 해내는 일들
개인 생산성은 눈에 보이는 꼭대기일 뿐입니다. 물량은 다른 곳에 있습니다.
컨택 센터는 아마도 가장 큰 상업적 도입처일 것입니다. 실시간 인식은 상담원 지원 패널로 흘러들어 대화 도중에 맞는 답을 떠올려 주고, 품질 관리를 2% 표본을 듣는 일에서 모든 통화를 채점하는 일로 바꿔 놓습니다. 라우팅, 컴플라이언스 점검, 통화 후 요약이 모두 같은 전사본 위에 얹힙니다.
접근성과 자막은 이 기술이 선택 사항이기를 그만둔 영역입니다. 미국에서는 법무부의 Title II 규정이 주 정부와 지방 정부 디지털 콘텐츠 기준으로 WCAG 2.1 레벨 AA를 정했고, 준수 기한은 인구 규모에 따라 2027년 4월과 2028년 4월로 나뉘며, 민간 조직도 대체로 같은 기준에 맞춰 만듭니다. 별도로 2026년 8월 17일부터 FCC는 해당 기기 제조사와 다채널 영상 배급 사업자에게 폐쇄 자막 표시 설정을 쉽게 접근할 수 있게 하도록 요구합니다. 분명히 해 둘 것이 있습니다. 자동 자막만으로는 이 규정들이 전제하는 정확도 기준에 대체로 도달하지 못합니다. 문장 부호를 엉성하게 찍고, 이름을 망가뜨리고, 청각 장애 시청자에게 필요한 비언어 소리를 건너뜁니다. 규정을 충족하는 방식은 기계 초안에 사람 교정을 더하는 것입니다.
진료 문서화는 여전히 거대한 시장이지만, 보호 대상 건강 정보를 건드리는 일은 범용 앱이 아니라 필요한 계약에 서명해 줄 벤더가 필요합니다. 법원은 인증된 사람의 검토를 전제로 한 1차 처리로 사용합니다. 미디어와 교육은 아카이브를 검색 가능하게 만드는 데 씁니다. 40시간짜리 강의 시리즈에 자막을 다는 진짜 보상은 고유값을 다루는 그 네 분을 찾아내는 것입니다.
그리고 회의가 있습니다. 오늘날 대부분의 사무직이 이 기술을 만나는 방식이죠. 시스템이 통화를 담아 타임스탬프와 화자 라벨이 붙은 기록을 만들어 내고, 글의 벽을 그냥 건네주는 대신 그다음에 무언가를 해 주는 방향으로 점점 가고 있습니다.
운영체제 기본, 앱 내장, 전용 도구, 아니면 API
모든 음성 텍스트 변환 제품은 네 개의 바구니 중 하나에 들어가고, 그 바구니는 브랜드보다 당신의 경험을 더 잘 예측합니다.
| 분류 | 무엇인가 | 강점 | 한계가 오는 지점 | 일반적인 비용 |
|---|---|---|---|---|
| 운영체제 기본 기능 | Windows, macOS, iOS, Android에 딸려 오는 받아쓰기 | 무료, 최신 기기에서는 기기 내 처리, 설정 불필요, 키보드가 되는 곳이면 어디서나 | 서식이 빈약하고, 제대로 된 커스텀 어휘가 없으며, 기록이 남지 않음 | 포함 |
| 앱에 내장 | 문서 편집기, 브라우저, 화상 회의 도구 안의 음성 입력 | 맥락 안에 있고, 설치할 것이 없으며, 그 한 가지 용도에는 충분 | 앱 경계에서 멈춤. 텍스트는 만들어진 자리에 갇힘 | 앱에 포함 |
| 전용 음성 텍스트 변환 앱 | 단독 받아쓰기 키보드와 회의 어시스턴트 | 군말과 문장 부호 정리, 커스텀 어휘, 앱 간 사용, 요약 | 구독이 하나 더 늘고, 대개 클라우드라 오디오가 기기를 떠남 | 사용자당 월 $10–$20 수준 |
| 개발자 API와 오픈 모델 | 클라우드 인식 엔드포인트, 또는 직접 호스팅하는 오픈 모델 | 완전한 통제, 튜닝, 스트리밍 또는 배치, 물량 기반 가격 | 그 주위에 제품을 직접 만들어야 함. 상자에서 꺼내 쓸 수 없음 | 오디오 시간당 종량 과금, 또는 자체 연산 자원 |
세 번째 바구니 안에서 흥미로운 갈림길은 단어가 만들어진 다음에 무슨 일이 벌어지는가입니다. 어떤 도구는 텍스트에서 멈춥니다. 어떤 도구는 전사본을 원자재로 다룹니다. 예를 들어 Laxis는 Zoom, Google Meet, Microsoft Teams 통화를 100개가 넘는 언어로 녹음하고 전사한 뒤, 액션 아이템을 뽑아 결과를 HubSpot이나 Salesforce로 밀어 넣습니다. 이는 더 빨리 타이핑하는 것과는 다른 일입니다. 추상적으로는 어느 쪽도 이기지 않습니다. 서로 다른 질문에 답할 뿐입니다. 여기까지 읽은 주된 이유가 어떤 제품을 살지 정하기 위해서라면, 우리의 주요 받아쓰기 도구 실사용 비교가 이름을 직접 거론합니다. 이 글은 일부러 그러지 않았습니다.
세 가지 가격 형태, 그리고 함정 하나
비용은 당신이 어느 바구니에 있는지에 전적으로 달려 있고, 그 형태들은 서로 비교되지 않습니다.
무료는 운영체제 층위에서는 진짜로 무료라는 뜻입니다. 주요 플랫폼은 모두 받아쓰기를 기본 탑재하고 있고, 짧게 쓰는 용도라면 기본 기능으로 충분하며, 서버가 아니라 기기에서 도는 비중도 점점 커지고 있습니다.
좌석 단위 구독은 전용 도구의 표준으로, 사용자당 월 $10에서 $20 사이에 몰려 있고 보통 시작용 무료 한도가 붙습니다. 우리 가격도 그 구간에 있습니다. 무료 등급은 월 300분의 전사를 제공하고, 그 위로 Premium이 사용자당 $15.99, Business가 $29.99입니다. 중요한 계산은 표시 가격이 아니라 당신의 사용량입니다. 주당 몇 시간씩 처리한다면 묶음 분수가 이기고, 한 달에 두 번 건드린다면 종량제가 이깁니다.
종량제 API 가격에 진짜 단위 경제학이 있고, 2026년 정가는 놀라울 만큼 낮습니다. AssemblyAI는 비동기 전사를 Universal-2에서 오디오 시간당 약 $0.15, Universal-3.5 Pro에서 $0.21로 공개하고, 실시간 스트리밍은 $0.45입니다. Deepgram의 Nova-3는 배치가 분당 약 $0.0043, 스트리밍이 $0.0077로 표시되며, 시간으로 환산하면 대략 $0.26과 $0.46입니다. OpenAI의 GPT-4o Transcribe는 천 분당 약 $6, Google Cloud 표준 등급은 물량 할인 전 천 분당 약 $16입니다.
모두에게 공통으로 적용되는 패턴이 둘 있습니다. 같은 오디오라도 스트리밍은 배치 처리보다 눈에 띄게 비싸고, 흔히 40~50% 더 듭니다. 열어 둔 연결과 더 빡빡한 지연에 값을 치르는 것이니까요. 그리고 표시 가격은 가격이 아니라 바닥입니다. 화자 분리, 요약, 비식별화, 감정 분석, 커스텀 어휘를 모두 켜면 실효 비용은 가격 페이지가 시사하는 것의 두 배에서 네 배까지 올라갈 수 있습니다. 그것이 함정입니다.
음성 텍스트 변환을 당신의 통화에 투입하세요
Laxis는 Zoom, Google Meet, Microsoft Teams 회의를 100개 이상의 언어로 녹음·전사·요약하고, 액션 아이템을 추출하며, HubSpot과 Salesforce에 동기화합니다. 무료 요금제에는 월 300분의 전사가 포함됩니다.
실제로 바뀐 것, 그리고 다가오는 것
세 가지 전환이 이 기술이 왜 답답하기를 그만두고 계속 좋아졌는지를 설명합니다.
첫째는 구조입니다. 음향·발음·언어 부품을 따로 만들어 이어 붙이던 수제 파이프라인은, 녹음된 음성과 그 글로 된 형태를 짝지은 방대한 아카이브에 맞춰 학습된 단일 신경망에 자리를 내주었습니다. 억양과 언어, 편한 말투에 대한 대응이 그토록 급격히 좋아진 이유가 이것이고, 실패의 양상이 달라진 이유도 같습니다. 옛 시스템은 대놓고 헛소리를 내놓았습니다. 새 시스템은 자신만만하고 유창한 오류를 내놓습니다.
둘째는 모델이 옮겨 다닐 만큼 작아졌다는 점입니다. 한때 데이터센터가 필요했던 인식이 이제 휴대폰에서 돌고, 일부 화상 회의와 자막 기능은 기본값으로 로컬에서 처리합니다. 연결이 필요 없고 오디오가 밖으로 나가지 않으니 프라이버시와 안정성 면에서 실질적인 이득입니다. 어려운 오디오, 낯선 어휘, 롱테일 언어에서는 클라우드 모델이 여전히 우위를 지키는데, 이것이 우리 같은 클라우드 기반 도구 뒤에 놓인 솔직한 맞바꿈입니다.
셋째는 스트리밍 구조입니다. 오디오를 프레임 단위로 소비하고 이미 본 부분은 다시 처리하는 대신 캐시해 두도록 설계된 인코더들이 실시간 지연을 충분히 낮춰, 기계에게 말을 거는 일이 무전기로 번갈아 말하는 것처럼 느껴지지 않게 만들었습니다. NVIDIA가 2026년에 내놓은 캐시 인지 컨포머 연구가 공개된 사례 하나입니다.
다음에 올 것은 정확도가 한 포인트 더 오르는 이야기보다 흥미롭습니다. 오디오 위에서 직접 작동하는 모델들, 즉 중간 전사본을 한 번도 확정하지 않고 말로 된 질문에 답하는 모델들은 이 글이 설명한 단계를 통째로 건너뛰며, 이미 어시스턴트 제품에 실려 나오고 있습니다. 평가 방식도 압박을 받고 있습니다. 단어 오류율은 빠진 "the"와 빠진 "not"을 똑같이 취급하는데 이는 명백히 틀렸고, 연구자들은 의미에 가중치를 주는 척도 쪽으로 밀고 있습니다. 이 모든 것을 떠받치는 채택률과 시장 수치는 우리의 2026년 카테고리 현황 보고서에 있습니다.
결론
남은 문제는 듣는 것이 아닙니다. 깨끗한 오디오에서 이 기술은 이미 끝났습니다. 대부분의 사람보다 정확하고, 모든 사람보다 빠르며, 분당 1센트의 몇 분의 1 수준의 비용으로 돌아갑니다. 풀리지 않은 것은 사람 쪽입니다. 누가 말했는지 아는 것, 무엇이 중요했는지 아는 것, 그리고 자기가 알아듣지 못했을 때를 아는 것.
마지막 것이 진짜 최전선입니다. "이 줄은 확신이 없습니다"라고 말할 수 있는 시스템은, 정확도가 두 포인트 높으면서 자기 실수에 대해 입을 다무는 시스템보다 가치가 큽니다. 그때까지는 자동 생성된 텍스트를, 빠르고 자신만만하며 "죄송한데 다시 한번 말씀해 주시겠어요?"라고 단 한 번도 말한 적 없는 동료가 쓴 훌륭한 초안으로 대하십시오.
자주 묻는 질문
음성 텍스트 변환이란 무엇인가요?
음성 텍스트 변환은 말한 오디오를 글로 바꾸는 기술이며, 정식 명칭은 자동 음성 인식입니다. 말하는 동안 화면에 단어가 나타나는 실시간 사용과, 저장된 오디오나 영상 파일을 나중에 처리하는 오프라인 사용을 모두 포괄합니다. 받아쓰기 앱, 실시간 자막, 전화 어시스턴트, 회의 도구는 모두 그 위에 지어진 제품입니다.
자동 음성 인식은 어떻게 작동하나요?
자동 음성 인식 시스템은 먼저 마이크 신호를 소리에 대한 수치적 기술로 바꾸고, 그다음 신경망이 그 신호를 만들어 냈을 가능성이 가장 높은 단어 배열을 탐색합니다. 이 탐색은 음향적 증거와 어떤 표현이 해당 언어에서 얼마나 그럴듯한지를 저울질하며, 그래서 마이크가 잘 담지 못한 소리를 문맥이 고쳐 줍니다. 서식과 화자 라벨은 그 뒤에 붙습니다.
음성 텍스트 변환은 얼마나 정확한가요?
한 사람의 깨끗한 녹음에서는 선두 엔진들이 대략 2에서 5퍼센트의 단어 오류율을 기록하며, 이는 단어의 95에서 98퍼센트가 정확하다는 뜻입니다. 뒤섞인 실제 오디오 전반에 대해 공개된 수치는 훨씬 넓게 퍼져 약 85에서 98퍼센트에 걸치고, 여러 사람이 어지럽게 말하는 회의 오디오는 15에서 25퍼센트 오류 구간으로 보고되는 경우가 많습니다. 당신의 마이크와 당신의 방이 벤더보다 중요합니다.
음성 인식과 화자 인식의 차이는 무엇인가요?
음성 인식은 어떤 단어가 말해졌는지를 알아냅니다. 엄밀한 의미의 화자 인식은 목소리 특징을 등록된 성문과 대조해 누가 말했는지를 알아내며, 은행이 전화를 건 사람을 확인할 때 쓰는 것이 이쪽입니다. 둘은 별개의 시스템으로 돌아가고 별개의 질문에 답하지만, 일상적인 글에서는 둘 중 어느 쪽이든 뭉뚱그려 가리키는 경우가 흔합니다.
음성 텍스트 변환은 무료인가요?
소규모라면 무료입니다. Windows, macOS, iOS, Android는 모두 받아쓰기를 무료로 포함하고 있고, 브라우저와 오피스 제품군도 각자의 음성 입력을 얹어 줍니다. 유료 도구는 좌석당 월 요금을 받거나 API를 통한 종량 요금을 받습니다. 월 요금은 흔히 10에서 20달러 수준이고, 종량 요금의 2026년 정가는 오디오 시간당 대략 0.15에서 1달러 사이입니다.
음성 텍스트 변환은 오프라인에서도 되나요?
일부는 됩니다. 휴대폰과 노트북에는 이제 로컬에서 도는 압축된 인식 모델이 기본 탑재되어, 기본적인 받아쓰기와 일부 실시간 자막은 연결이 없어도, 오디오가 기기를 떠나지 않아도 계속 작동합니다. 더 큰 클라우드 모델은 어려운 오디오, 넓은 어휘, 다국어에서 대체로 여전히 강하기 때문에 Laxis를 포함한 대부분의 업무용 도구는 클라우드에서 처리합니다.
음성 텍스트 변환과 텍스트 음성 변환의 차이는 무엇인가요?
방향이 반대입니다. 음성 텍스트 변환은 오디오를 듣고 글로 된 단어를 내놓습니다. 텍스트 음성 변환은 글로 된 단어를 읽고 합성 오디오를 내놓으며, 스크린 리더와 오디오북 낭독, 음성 어시스턴트의 응답을 움직이는 것이 이것입니다. 음성 어시스턴트는 둘 다 씁니다. 요청을 듣기 위해 인식을, 답하기 위해 합성을 사용합니다.