Проект нацелен на оптимизацию ресурсов. Позволяет запустить модель на 70B параметров с GPU 4ГБ оперативки. Раньше требовалось от 35 до 168ГБ
Можно запустить 405B Llama 3.1 на 8ГБ оперативки. Но скорость генерации будет 1 токен/секунду
Как они это делают?
AirLLM загружает модель слой за слоем, оптимизируя использование памяти. Они предсказывают следующий слой. Загружают его в память и выгружают прошлый. Так проходят всю итерацию.
Где применять?
Я подумал над background задачами. Где не нужно давать быстрые ответы, а можно дать большой модельке подумать 10-20ч для отчета на собственных ресурсах.
PS но ещё надо перепроверить, действительно ли окупается такая генерация? 5ч GPU крутить на своем железе или заплатить 10$ крупным ребятам за токены
