수업 · 중급 14

AI는 내 목소리를 어떻게 알아들을까? 음성 인식

목소리의 떨림을 숫자로 바꾸고, 소리 조각을 맞히고, 문장으로 다듬어요.

최종 검수일 2026-10-12

글자 크기
보통

한 줄 요약

마이크는 목소리의 떨림을 숫자로 바꿔요. 음성 인식 AI는 이 숫자를 아주 짧은 조각으로 잘라 어떤 소리인지 맞히고, 앞뒤 말을 살펴 알맞은 문장으로 다듬어요.

학습 목표

  • 음성 인식의 4단계(소리를 숫자로 → 짧게 자르기 → 소리 단위 찾기 → 문장으로 다듬기)를 설명할 수 있어요.
  • 파형과 음소의 뜻을 말할 수 있어요.
  • 소음, 말 빠르기, 학습 데이터가 정확도에 주는 영향을 알 수 있어요.

생활 속 비유: 시끄러운 운동장에서 알아듣기

쉬는 시간 운동장은 시끄러워서 친구 말이 띄엄띄엄 들려요. 그래도 “…이따 …구 하자!”라고 들리면 “이따 축구 하자!”라고 알아듣지요. 들린 소리 조각에 앞뒤 말과 상황을 더해 빈칸을 채운 거예요. 음성 인식 AI도 소리 조각을 맞힌 다음, 앞뒤 말로 가장 그럴듯한 문장을 골라요. 그래서 소리가 너무 작거나 시끄러우면 엉뚱한 문장을 고르기도 해요.

인포그래픽

AI는 내 목소리를 어떻게 알아들을까? 음성 인식 인포그래픽. 목소리의 떨림을 숫자로 바꾸고, 소리 조각을 맞히고, 문장으로 다듬어요. 크게 보기 (새 탭)
크게 보기
그림 내용 글로 보기

중급 14

AI는 내 목소리를 어떻게 알아들을까? 음성 인식

목소리도 숫자로 바뀌어요.소리 조각을 글자로 맞추고 앞뒤 말로 다듬어요.

“시끄러워도앞뒤 말로 알아들었어!”

음성 인식도 앞뒤 말로 글자를 짐작해요.

  • 1. 소리를 숫자로
  • 2. 짧게 자르기
  • 3. 소리 단위 찾기
  • 4. 문장으로 다듬기
  • 파형 소리의 떨림을 그린 모양
  • 음소 말소리를 이루는 가장 작은 소리 단위

Q. 음성 인식은 주변이 시끄러워도 항상 똑같이 정확하다?

정답: X

그림으로 보는 흐름

  1. 소리를 숫자로

    마이크가 공기의 떨림을 파형(소리 그래프)으로 바꾸고, 이를 숫자로 저장해요.

  2. 짧게 자르기

    소리를 1초보다 훨씬 짧은 조각으로 잘라요.

  3. 소리 단위 찾기

    조각마다 ‘ㅂ’, ‘ㅏ’ 같은 소리 단위 중 무엇에 가까운지 맞혀요.

  4. 문장으로 다듬기

    앞뒤 말을 살펴 “밥 먹자”처럼 알맞은 낱말과 문장으로 바꿔요.

꼭 알아야 할 단어

  • 파형 waveform 소리의 떨림을 그린 모양
  • 음소 phoneme 말소리를 이루는 가장 작은 소리 단위 (예: ‘밥’은 ㅂ, ㅏ, ㅂ)

직접 해보기: 세 가지 상황에서 음성 입력하기

보호자와 함께 스마트폰 키보드의 음성 입력(마이크 버튼)을 켜고, 같은 문장 “내일 아침에 운동장에서 만나자”를 세 번 말해 보세요. ① 조용한 방에서 또박또박 ② 텔레비전 소리를 켜 둔 채로 ③ 아주 빠르게. 받아 적힌 글자가 어떻게 달라지는지 비교해요. 새로 가입할 필요는 없고, 이름이나 주소 같은 개인 정보는 말하지 않아요.

  1. 조용한 방에서 또박또박 말해요.
  2. 텔레비전 소리를 켜 둔 채로 말해요.
  3. 아주 빠르게 말해요.

새로 가입할 필요는 없고, 이름이나 주소 같은 개인 정보는 말하지 않아요.

음성 인식은 소리 조각과 앞뒤 말로 문장을 짐작해요. 그래서 상황에 따라 정확도가 달라져요.

확인 퀴즈

정답과 점수는 저장하지 않습니다.

  1. 음성 인식은 주변이 시끄러워도 항상 똑같이 정확하다.

    정답 보기

    정답 X. 소음이 크면 소리 조각을 잘못 맞혀 틀리기 쉬워요.

  2. 음성 인식이 틀리기 쉬운 경우가 아닌 것은?

    • ① 주변 소음이 클 때
    • ② 여러 사람이 동시에 말할 때
    • ③ 조용한 곳에서 또박또박 말할 때
    정답 보기

    정답 ③. 조용하고 또렷할수록 정확해져요.

중2 한 걸음 더

중2 한 걸음 더: 스펙트로그램과 목소리 데이터

음성 인식 AI는 소리를 보통 수십 밀리초(1밀리초는 1000분의 1초) 길이의 조각으로 자른 뒤, 높고 낮은 소리가 얼마나 섞였는지를 그림처럼 나타낸 ‘스펙트로그램(spectrogram)’으로 바꿔 분석해요. 요즘은 소리에서 글자까지 한 번에 바꾸는 방식도 많이 쓰여요.

사투리나 어린이 목소리처럼 학습 데이터가 적은 말은 정확도가 낮을 수 있어서, 다양한 목소리 데이터가 필요해요. 목소리도 나를 알아볼 수 있는 개인 정보이니 함부로 녹음해 올리지 않아요.

쉽게 풀어 보기

목소리도 숫자가 돼요

말을 하면 공기가 떨려요. 마이크는 이 떨림을 받아 파형(waveform), 곧 소리의 떨림을 그린 모양으로 바꾸고, 다시 숫자로 저장해요.

음성 인식 AI는 이 숫자를 1초보다 훨씬 짧은 조각으로 잘라요. 그리고 조각마다 어떤 소리에 가까운지 맞혀요.

이때 맞히는 소리 단위가 음소(phoneme)예요. 음소는 말소리를 이루는 가장 작은 소리 단위예요. 예를 들어 ‘밥’은 ㅂ, ㅏ, ㅂ으로 이루어져요.

시끄러운 운동장에서 알아듣기로 이해해요

쉬는 시간 운동장은 시끄러워서 친구 말이 띄엄띄엄 들려요. 그래도 “…이따 …구 하자!”라고 들리면 “이따 축구 하자!”라고 알아듣지요. 들린 소리 조각에 앞뒤 말과 상황을 더해 빈칸을 채운 거예요.

음성 인식 AI도 소리 조각을 맞힌 다음, 앞뒤 말로 가장 그럴듯한 문장을 골라요.

그래서 소리가 너무 작거나 시끄러우면 엉뚱한 문장을 고르기도 해요.

생활 속 음성 인식

키보드의 마이크 버튼으로 말을 글자로 받아 적기, 영상의 자동 자막, AI 비서, 자동차의 음성 명령이 모두 음성 인식이에요.

손이 바쁘거나 글자를 치기 어려운 사람에게 큰 도움이 돼요. 회의나 수업 내용을 글로 남기는 데도 쓰여요.

하지만 조용하고 또렷할수록 정확하고, 소음, 여러 사람이 동시에 말하기, 아주 빠른 말에서는 틀리기 쉬워요. 받아 적힌 글은 꼭 다시 읽고 고쳐요.

뒤에 나오는 ‘직접 해보기 미션’에서 같은 문장을 세 가지 상황에서 말해 비교해 봐요.

숫자로 보기

  • 사실 1,000분의 1초 1밀리초(ms)의 길이. 음성 인식은 소리를 수십 밀리초 조각으로 잘라요.
  • 예시 ㅂ·ㅏ·ㅂ ‘밥’을 이루는 음소 3개. AI는 조각마다 이런 소리 단위를 맞혀요.
  • 예시 3가지 미션에서 비교할 상황: 조용히 또박또박, TV 소리 켜고, 아주 빠르게

표로 정리해요

음성 인식의 4단계
단계 하는 일 “밥 먹자” 예시
소리를 숫자로 마이크가 공기의 떨림을 파형(소리 그래프)으로 바꾸고, 이를 숫자로 저장해요. “밥 먹자” 소리가 파형이 돼요.
짧게 자르기 소리를 1초보다 훨씬 짧은 조각으로 잘라요. 아주 짧은 조각 여러 개
소리 단위 찾기 조각마다 ‘ㅂ’, ‘ㅏ’ 같은 소리 단위 중 무엇에 가까운지 맞혀요. ㅂ, ㅏ, ㅂ, ㅁ, ㅓ…
문장으로 다듬기 앞뒤 말을 살펴 “밥 먹자”처럼 알맞은 낱말과 문장으로 바꿔요. “밥 먹자” (“밤 먹자”가 아니라)
잘 알아들을 때와 틀리기 쉬울 때
살펴봐요 잘 알아들어요 틀리기 쉬워요
주변 소리 조용한 곳 소음이 큰 곳, TV 소리
말하는 방법 또박또박, 알맞은 빠르기 아주 빠르게, 웅얼웅얼
말하는 사람 한 사람씩 여러 사람이 동시에
말의 종류 학습 데이터에 많은 말 데이터가 적은 사투리, 새 낱말

그래프로 보기

예시 상황에 따라 맞게 받아 적은 낱말 비율
  • 조용한 방또박또박 95
  • TV 소리켜 둠 70
  • 아주빠르게 60

맞게 받아 적은 낱말 (%) · 말한 상황

※ 이해를 도우려고 만든 예시 숫자예요. 실제 결과는 기기, 목소리, 주변 소리에 따라 달라요.

용어 정리

이 차시에서 쓰는 말
용어 영어 뜻 예
음성 인식 speech recognition 목소리를 글자로 바꾸는 기술 음성 입력, 자동 자막
파형 waveform 소리의 떨림을 그린 모양 오르내리는 소리 그래프
음소 phoneme 말소리를 이루는 가장 작은 소리 단위 ㅂ, ㅏ, ㅂ
마이크 microphone 소리의 떨림을 전기 신호로 바꾸는 장치 스마트폰 마이크
소음 noise 듣고 싶은 소리를 가리는 다른 소리 TV 소리, 바람 소리
밀리초 millisecond 1,000분의 1초 20밀리초 조각
스펙트로그램 spectrogram 높고 낮은 소리가 섞인 정도를 그림으로 나타낸 것 소리의 지문 같은 그림
맥락 context 앞뒤 말과 상황 “이따 …구 하자” → 축구
자동 자막 auto caption 영상 속 말을 자동으로 글자로 보여 주기 영상 앱 자막
사투리 dialect 지역마다 다른 말씨 경상도, 전라도 말씨

활동지 문제

활동지 문제
  1. 말소리를 이루는 가장 작은 소리 단위를 ( )(이)라고 해요.

    정답 보기

    정답 음소(phoneme) . ‘밥’은 ㅂ, ㅏ, ㅂ 세 음소예요.

  2. 사투리나 어린이 목소리에서 음성 인식이 덜 정확할 수 있는 까닭을 써 보세요.

    정답 보기

    정답 (예시 답) 학습 데이터에 그런 목소리가 적어서, AI가 그 소리의 특징을 충분히 배우지 못했기 때문이에요.

교사용 박스

수업에서 바로 쓰는 지도 팁입니다.

수업 흐름(40분)

40분 수업의 네 구간
구간 시간 활동
도입 5분 시끄러운 운동장에서 띄엄띄엄 들린 말을 맞혀 보는 놀이를 합니다(교사가 일부 글자를 빼고 말하기).
개념 10분 소리를 숫자로 → 짧게 자르기 → 소리 단위 찾기 → 문장으로 다듬기의 흐름을 설명합니다.
활동 20분 교사 기기의 음성 입력으로 “내일 아침에 운동장에서 만나자”를 조용할 때·소음이 있을 때·빠르게 말할 때 세 번 받아 적게 하고, 학생은 결과 차이를 기록합니다.
정리 5분 음성 인식이 틀리기 쉬운 조건을 정리하고 퀴즈를 풉니다.

도입 질문

  • 친구 말이 일부만 들렸는데도 알아들은 적이 있나요? 어떻게 알아들었을까요?
  • 시끄러운 곳에서 음성 입력을 쓰면 어떻게 될까요?

자주 하는 오개념

  • 오개념. 음성 인식은 어디서나 똑같이 정확하다.

    바로잡기. 세 조건 실험 결과를 비교해 소음·속도에 따라 결과가 달라지는 것을 직접 확인합니다.

  • 오개념. AI는 들린 소리만 그대로 받아 적는다.

    바로잡기. 앞뒤 말로 가장 그럴듯한 문장을 고르는 단계(④)가 있어 엉뚱한 문장이 나오기도 한다고 설명합니다.

활동 준비물

  • 교사용 기기(음성 입력)
  • 결과 기록표

안전 유의점

  • 녹음 파일은 저장하거나 올리지 않습니다. 학생 목소리 대신 교사가 말하는 방식으로 시연합니다.
  • 이름이나 주소 같은 개인 정보는 말하지 않습니다.

평가 포인트

  • 음성 인식의 4단계를 순서대로 말할 수 있는가
  • 음성 인식이 틀리기 쉬운 조건을 2가지 이상 말할 수 있는가

초6·중2 차이를 두는 법

초6

세 조건 비교 실험과 결과 기록에 집중합니다.

중2

스펙트로그램과, 학습 데이터가 적은 말(사투리 등)의 정확도 문제를 더해 25강 편향과 연결합니다.

내려받기

PDF 내려받기 DOCX 내려받기

전체 합본 PDF