EdigE
← ЛЕНТА
TOOLS · 13.07.2026

Беззвучная речь через ультразвуковое видео языка: 15,6% WER на открытом словаре

Ультразвуковой зонд под подбородком позволил Aleph восстановить текст по движениям языка при беззвучной артикуляции. Внутренняя cross-speaker open-vocabulary валидация дала 15.6% WER после обучения примерно на 50 часах записей. Главный барьер для носимого интерфейса пока лежит в механике контакта: прототипу нужны тяжёлый датчик и акустический гель.

Aleph представила прототип интерфейса беззвучной речи, который считывает артикуляцию ультразвуковым изображением языка. Зонд устанавливается под подбородком и формирует видеопоток с движениями задней и средней частей языка во время произнесения фраз про себя или с беззвучной артикуляцией. На внутренней валидации с новыми для модели спикерами и открытым словарём команда заявила word error rate 15.6%.

Сигнал проходит через видеоэнкодер ResNet-18 2+1D. Такая сеть разделяет пространственную обработку кадров и временную обработку последовательности, поэтому может выделять динамику языка, а не только отдельные ультразвуковые срезы. Полученные видеоэмбеддинги обучались приближаться к представлениям аудиоэнкодера Whisper для той же фразы. Текст затем декодирует компактная версия Whisper Base. Это переносит в канал ультразвукового видео языковую структуру, уже выученную аудиомоделью, и уменьшает объём данных, необходимый для обучения декодера с нуля.

Набор данных занял около 50 часов. Участники читали короткие синтетические рассказы вслух: звук использовался для контроля соответствия произнесённого текста заданной фразе, положения датчика и качества акустического контакта. Авторы отдельно проверяли перенос на беззвучную артикуляцию. По их графику масштабирования WER снизился со 102% при 15 тыс. обучающих примеров до 15.6% при 50 тыс. Рост датасета здесь влияет сразу на два слабых места: вариативность анатомии и нестабильность ультразвуковой картинки при малых смещениях зонда.

Aleph; авторы страницы: Vadims Casecnikovs, Gimran Abdullin, Raffi Hotter и Lev Chizhov.

Физический смысл подхода связан с тем, что язык участвует в формировании большей части согласных и гласных. Aleph оценивает число различимых по движениям языка фонемных классов примерно в 34, тогда как наблюдение за губами даёт около 10–14 визуально различимых конфигураций. УЗ-визуализация также не использует микрофонный тракт, поэтому речевой шум помещения не попадает во входной сигнал. На качество по-прежнему способны влиять давление на датчик, слой геля, движение головы, индивидуальная геометрия тканей и артефакты изображения.

Заявленная цифра 15.6% относится к внутреннему набору Aleph. Публичного внешнего бенчмарка, полного описания разбиения по спикерам, доверительных интервалов и независимой репликации пока нет. Обобщение на ранее не встречавшихся пользователей также показано преимущественно для американского акцента; для других акцентов команда отмечает снижение качества.

Аппаратная часть остаётся наиболее приземлённым ограничением. Использованный зонд велик и тяжёл для постоянного ношения, а для передачи ультразвука через границу датчик—кожа необходима контактная среда. Следующая заявленная цель — тонкий приклеиваемый патч с гидрогелем. Такой форм-фактор потребует сохранить акустическое сопряжение при мимике и смещении кожи, удержать повторяемое положение апертуры относительно языка и обеспечить стабильный захват видеоданных в компактной электронике. Именно эти параметры определят, сможет ли лабораторная схема перейти в носимый интерфейс для тихой связи и вспомогательной коммуникации.