Я вычислю тебя по бз-бз-бз: создали ИИ-устройство против малярии

5 мин
Я вычислю тебя по бз-бз-бз: создали ИИ-устройство против малярии

Пока все внимание приковано к гонке ИИ-гигантов и большим потреблениям энергии, денег и т. п., на противоположном конце технологического спектра происходит тихая революция. На прошедшем в Женеве саммите ООН AI for Good представили мобильный прибор для борбы с малярией и лихорадкой денге, разработанный группой исследователей, включая доцента UOW Киранa Триведи.

Для эпидемиологов это прорыв: традиционный мониторинг требует сбора проб воды, транспортировки личинок в лабораторию и их ручного анализа под микроскопом. Но с инженерной точки зрения куда интереснее другое — то, как именно полноценную нейросеть для обработки аудио удалось «утрамбовать» в микроконтроллер стоимостью $10.

Архитектура задачи

Все комары звучат одинаково только для человека, пытающегося заснуть. 

С точки зрения физики каждый вид имеет уникальную частоту взмахов крыльев и форму акустической волны:

  • Aedes — переносчик лихорадки денге и вируса Зика;

  • Anopheles — основной вектор малярии;

  • Culex — переносчик вируса Западного Нила.

Девайс с точностью 88,3% идентифицирует опасных комаров в реальном времени по звуку их взмахов крыльев. Главная особенность системы — она работает автономно на платах класса Arduino без подключения к интернету.

Киран Триведи и устройство. Ресурс.

Их базовые частоты и спектральные подписи различаются — зачастую на десятки герц и более, плюс по структуре гармоник. Проблема звучит просто: взять сигнал с микрофона, построить спектрограмму и классифицировать ее нейросетью. Тем не менее попытка запустить классическую CNN или CRNN на ограниченном железе упирается в жесткие ресурсы микроконтроллеров: сотни килобайт RAM вместо десятков гигабайт VRAM.

+------------------------------------------------------------------+
|                         FULL ML PIPELINE                         |
+------------------------------------------------------------------+
|  1. Обучение и подготовка (Cloud / GPU)                          |
|     Сырой звук -> Спектрограммы -> Обучение тяжелой CNN/CRNN     |
+------------------------------------------------------------------+
                                   |
                                   v
|  2. Оптимизация (Quantization & Pruning)                         |
|     FP32 -> INT8, удаление лишних весов, сборка в TFLite Micro   |
+------------------------------------------------------------------+
                                   |
                                   v
|  3. Offline-инференс (Edge / TinyML)                             |
|     Микрофон -> DSP (FFT) -> INT8-модель на MCU -> Результат     |
+------------------------------------------------------------------+

Как устроена разработка

Распространенное заблуждение о TinyML заключается в том, что микроконтроллеры делают все сами. По-настоящему же, процесс разделен на два этапа.

Этап 1. Тяжелое обучение и конвертация спектрограмм

Схема не может родиться на микроконтроллере. Первичный датасет (в случае исследования — публичные библиотеки аудиозаписей полета комаров) требует серьезной предварительной обработки.

Аудиосигнал нарезается на короткие фреймы и превращается в Mel-Spectrograms или MFCC (Mel-Frequency Cepstral Coefficients). Это переводит задачу из области аудио в область компьютерного зрения: нейросеть учится искать паттерны на «картинках» частотного спектра.

Чтобы модель научилась выделять паттерны крыльев на фоне шума ветра и тропического дождя, требуются сотни эпох обучения и валидации. На этом этапе все еще используют GPU-кластеры, так как перебор гиперпараметров и аугментация аудиоданных требуют высокой параллельной вычислительной мощности.

Этап 2. Квантование и дистилляция 

Когда схема показала целевую точность (в эксперименте Триведи — 88,3%), начинается процедура ее жесткого урезания.

Начинается все с квантования, перевода весов из формата плавающей точки FP32 в целочисленный INT8. Это сокращает размер модели в четыре раза и позволяет выполнять математические операции на базовых ALU микроконтроллера без вызова программной эмуляции float.

Дальше Pruning, или удаление из нейросети связей и нейронов, имеющих близкий к нулю вклад в итоговый результат. 

Потом компиляция под C++. Итоговый граф переводится в исходник через фреймворки вроде TensorFlow Lite for Microcontrollers (TFLite Micro) или Edge Impulse. Схема превращается в обычный массив байтов, вшиваемый непосредственно в флэш-память чипа.

Обычно, после квантования и prunіng медианная модель для такой задачи занимает порядка сотен килобайт (например, 100–200 КБ)

Каталог готовых ИИ-моделей

Служба для запуска и управления LLM в облаке Selectel. Выберите модель, конфигурацию и получите готовый эндпоинт для работы с ней.

Подробнее →

Реальные инженерные ограничения

Вопреки красивую демонстрацию на саммите ООН, при переносе такой системы из лаборатории «в поле ввода» инженеры неизбежно столкнутся с двумя проблемами.

Задача

Лабораторные условия

Реальные тропики

Инженерное решение

Акустический шум

Чистые датасеты, изолированный звук

Ветер, дождь, шум транспорта, прочие насекомые

Использование аппаратных MEMS-микрофонов с направленностью + первичные DSP-фильтры

Автономия

Питание от USB-порта

Работа 24/7 в удаленных локациях

Сон микроконтроллера по таймеру / Активация по пороговому уровню громкости (Wake-on-Sound)

Прогноз: от изолированных чипов к IoT-сетям

Авторы проекта видят финальную цель не в создании отдельных приборов, а в построении распределенной сети датчиков.

Концепция похожа на работы сервисов вроде Waze или навигаторов: локальный чип определяет тип опасности, не тратит трафик на передачу аудиофайлов, а отправляет в сеть только короткий служебный пакет (координаты, timestamp, ID вида).

По замыслу авторов такие сети могли бы давать тепловые карты активности переносчиков и, потенциально, позволить реагировать на вспышки раньше, чем это отражается в статистике заболеваний.

А как вы думаете, есть ли у Edge-вычислений шанс забрать ощутимую долю рынка у классических облачных api? Делитесь мнением в комментариях.

Читают сейчас

Nvidia представила PAIR — утилиту, с помощью которой объединяет некоторое количество ПК и распределяет между ними AI‑задачи

1 час назад

Nvidia представила PAIR — утилиту, с помощью которой объединяет некоторое количество ПК и распределяет между ними AI‑задачи

Nvidia выпустила средство PAIR (Personal AI Router), который объединяет некоторое количество компьютеров в локальной сети и распределяет между ними задачи по запуску AI‑моделей. В один кластер можно п

1 час назад

H3 Max Director генерирует управляемый видеопоток в реальном времени

Новая релиз H3 Max генерирует не отдельные клипы с последующей склейкой, а единый непрерывный видеопоток. Схема сохраняет контекст сцены, персонажей и происходящего, а промпт можно менять прямо во вре

2 часа назад

Гипотеза панспермии начала понемногу переходить из статуса крамольной к статусу экстравагантной, но обсуждаемой

В июльском номере научного журнала Springer Nature была опубликована материал, название которой можно приблизительно перевести как "Следствие публикации Муди с соавторами для жизнеспособности гипотезы

2 часа назад

Агенты Cursor научились собирать приложения для iOS и macOS

Namespace интегрировала свою облачную инфраструктуру Devboxes с Cursor Cloud Agents. Сам Cursor по-прежнему отвечает за агентный цикл и управление задачей, а выполнение действий — работа с репозиторие

GPT-6 Astra: OpenAI хочет превратить ИИ из помощника в исполнителя задач

3 часа назад

GPT-6 Astra: OpenAI хочет превратить ИИ из помощника в исполнителя задач

OpenAI представила GPT-6 Astra – новую версию модели, в которой основной акцент сделан на выполнении сложных задач. В компании говорят о развитии возможностей работы с компьютером, программировании и