MP3

19 августа 2026 · ~11 мин чтения

формат-данных аудио сжатие стандарт история

MP3

MP3 (MPEG-1 Audio Layer III) — формат сжатия звука с потерями: он выбрасывает
из записи те детали, которые человеческое ухо физически не способно услышать,
и за счёт этого уменьшает файл примерно в 10 раз без заметной потери качества.

История

MP3 — редкий случай, когда у технологии есть конкретный «отец» и почти точная
дата рождения. Разработка шла в Институте Фраунгофера (Fraunhofer IIS, город
Эрланген, Германия) с конца 1980-х. Ключевая фигура — Карлхайнц Бранденбург
(Karlheinz Brandenburg), который занимался этой темой ещё в аспирантуре у
профессора Дитера Зайтцера в Университете Эрлангена-Нюрнберга. Задача эпохи
звучала так: как передать музыку приемлемого качества по цифровой телефонной
линии ISDN, где пропускная способность — жалкие 128 килобит в секунду, а звук
с CD требует 1411 килобит. Нужно было сжатие примерно в 11 раз.

Вехи:

Есть и легенда, которая при этом правда: Бранденбург отлаживал кодек на
а-капельной песне Сюзанны Веги «Tom's Diner» — голый голос без инструментов
беспощадно выявлял артефакты сжатия. Вегу с тех пор называют «матерью MP3».

Владельца у формата сегодня нет: стандарт открыт, патенты истекли, кодируй
и декодируй кто хочет.

Что это такое

MP3 — это формат сжатия звука с потерями (lossy). Ключевое слово —
«с потерями»: в отличие от ZIP-архива, из MP3 нельзя восстановить исходный
звук бит в бит. Часть информации выброшена навсегда. Фокус в том, какая
часть: алгоритм опирается на психоакустику — науку о том, что человеческое
ухо реально слышит, а что нет. Тихий звук сразу после громкого, частоты,
замаскированные соседними более громкими, ультразвук — всё это можно
выбросить, и слушатель не заметит.

Полезно развести три пары понятий:

Стандартные параметры: битрейт (скорость потока) от 32 до 320 килобит/с,
частоты дискретизации 32/44,1/48 кГц (и вдвое ниже в расширении MPEG-2 —
как раз для речи). 128 kbps долго считались «стандартом интернета», 320 kbps —
практический потолок качества. Метаданные (исполнитель, альбом, обложка)
живут в тегах ID3 — это отдельный блок, приклеенный к аудиопотоку.

Аналогии из жизни

Конспект лекции. Ты не стенографируешь дословно, а записываешь то, что
важно, отбрасывая воду, повторы и то, что и так очевидно. Конспект в 10 раз
короче, а смысл сохранён. Где ломается: по конспекту ты можешь додумать
и восстановить недостающее, потому что понимаешь смысл. MP3 ничего не
«понимает» — выброшенное не восстановит ни один декодер, оно исчезло физически.

Бульонный кубик. Из кастрюли бульона выпарили воду — осталась маленькая
плитка, которая при разведении даёт «примерно тот же» вкус. Компактно, удобно
хранить и возить. Где ломается: с кубиком заранее известно, что убрали
(воду), и убирают всегда одно и то же. MP3 в каждом фрагменте записи решает
заново, чем пожертвовать: в одном кадре — верхними частотами, в другом —
тихими деталями после удара барабана. Это адаптивный процесс, а не одна
фиксированная операция.

Упаковка чемодана перед полётом с лоукостером. Жёсткий лимит веса
(битрейт!), и ты выкладываешь вещи, без которых точно обойдёшься. Чем жёстче
лимит, тем более нужные вещи приходится оставлять — прямая аналогия с тем,
как на 64 kbps музыка начинает заметно «булькать». Где ломается: вещи из
чемодана ты выложил, но они остались дома — можно вернуться и забрать.
У MP3 «дома» ничего не остаётся: если исходник не сохранён отдельно,
выброшенные детали потеряны навсегда.

Как это работает

Пошагово, что происходит, когда кодер превращает WAV в MP3:

  1. Нарезка на кадры. Звук режется на кадры (frames) по 1152 сэмпла —
    при 44,1 кГц это примерно 26 миллисекунд звука. Каждый кадр кодируется
    почти независимо и имеет свой заголовок — поэтому MP3 можно слушать
    с середины файла и стримить по сети.

  2. Разложение по частотам. Каждый кадр прогоняется через банк фильтров:
    сначала 32 частотные полосы, затем каждая полоса дополнительно раскладывается
    через MDCT (модифицированное дискретное косинусное преобразование) — в сумме
    576 частотных линий. Грубо: вместо «звуковая волна во времени» получаем
    «сколько энергии на каждой частоте прямо сейчас».

  3. Психоакустическая модель. Параллельно отдельный анализатор смотрит
    на тот же кадр и вычисляет порог маскировки: какие частоты сейчас
    заглушены соседними громкими (частотная маскировка), какие тихие звуки
    не слышны сразу после громких (временна́я маскировка), что лежит ниже
    абсолютного порога слышимости. Итог — карта «здесь можно грубить,
    тут нужна точность».

  4. Квантование. Самый важный шаг с потерями. Значения частотных линий
    округляются: там, где ухо чувствительно, — мелкая шкала округления, где
    замаскировано — грубая. Ошибка округления и есть «потери», но она спрятана
    под порог маскировки, поэтому её не слышно.

  5. Кодирование Хаффмана. Округлённые числа дополнительно жмутся без потерь:
    частым значениям — короткие битовые коды, редким — длинные. Тот же принцип,
    что в ZIP.

  6. Bit reservoir (битовая копилка). Если простой кадр не израсходовал свой
    лимит бит, остаток передаётся сложному соседнему кадру. Поэтому даже при
    постоянном битрейте (CBR) качество внутри файла слегка «дышит». Режим VBR
    (переменный битрейт) делает это честнее: тишине — мало бит, сложному
    фрагменту — много.

  7. Стерео-хитрости. Joint stereo: вместо «левый + правый» кодируется
    «сумма + разность» каналов — разность обычно мала и жмётся лучше.

Декодер проходит цепочку в обратную сторону, но шаг 4 необратим: он лишь
достраивает звук из того, что осталось.

Почему нельзя «улучшить» MP3

Конвертация MP3 128 kbps в MP3 320 kbps или в FLAC не вернёт качество — выброшенное при первом кодировании потеряно навсегда. Хуже того, каждое перекодирование lossy → lossy накапливает новые потери: психоакустическая модель второго прохода режет уже порезанный звук по-своему. Правило простое: перекодируй всегда из исходника, а lossy-файл считай финальным продуктом.

Где встречается в обычной жизни

А вот голосовые сообщения в Telegram и WhatsApp — уже не MP3: там Opus,
современный кодек, который на низких битрейтах звучит заметно лучше.

Где встречается в IT и бизнесе

Кто пользуется

Альтернативы и конкуренты

Речь на низком битрейте — не для MP3

MP3 проектировался под музыку и битрейты от ~112 kbps. Если задача — голос в 16–32 kbps (телефония, диктофон, голосовые боты), Opus даст ту же разборчивость вдвое-втрое меньшим размером или заметно лучшее качество тем же. MP3 здесь выбирают только ради совместимости со старыми системами.

Когда НЕ стоит использовать

Связанные понятия

Литература и источники

Где встретилось у меня

Вчера строился пайплайн локальной транскрибации записей звонков колл-центра:
пара сотен MP3-файлов (телефонное качество — 24 kbps, 16 кГц, моно, суммарно
около суток речи) инкрементально прогонялись через модели распознавания речи,
а тексты складывались в SQLite-базу для дальнейшей аналитики. MP3 всплывал
на каждом шаге: скачивание записей, отбраковка битых файлов, декодирование
перед подачей в ASR-модель.

Краткое резюме