15,6% WER на открытом словаре показал прототип Aleph, который восстанавливает текст по ультразвуковому видео языка при беззвучной артикуляции. Видеоэнкодер ResNet-18 2+1D сближает движения языка с представлениями Whisper, а декодер Whisper Base переводит их в текст. Система обучалась примерно на 50 часах записей, но её носимый формат ограничивают тяжёлый зонд и акустический гель. →