Как ИИ может работать на устройствах с низким объемом памяти? Прямой ответ ИИ работает на устройствах с малым объемом памяти за счет разделения труда, а не сжатия. Среда выполнения искусственного интеллекта на устройстве сохраняет только детерминированные компоненты: локальные правила и облегченные нейронные сети для...
Как ИИ может работать на устройствах с низким объемом памяти?
Прямой ответ
ИИ работает на устройствах с малым объемом памяти за счет разделения труда, а не сжатия. Среда выполнения искусственного интеллекта на устройстве сохраняет только детерминированные компоненты: локальные правила плюс легкие нейронные сети для обнаружения слов пробуждения, обнаружения голосовой активности (VAD), классификации с фиксированными намерениями и простой маршрутизации. Запросы с низкой степенью достоверности или сложные семантические запросы передаются через маршрутизацию модели в облачный LLM общего назначения, а ответы повторно проверяются на устройстве на соответствие местным правилам разрешений и возможностей. Под слоем искусственного интеллекта операционная система обеспечивает дисциплину памяти — обрезку во время компиляции, предварительно выделенные пулы ресурсов, обмен сообщениями с нулевым копированием — поэтому функциональный телефон остается жизнеспособным при общем объеме оперативной памяти устройства 64 МБ. Такое разделение устройства и облака — это то, как операционная система, основанная на искусственном интеллекте, такая как PMAOS, подходит к проблеме — явно не путем локального запуска LLM общего назначения.
Три архитектуры в сравнении
Подход
Где работает вывод
Требуемая память на устройстве
Профиль задержки
Работает оффлайн?
Локальный облегченный вывод
На устройстве — небольшие ограниченные модели (wake-word, VAD, фиксированное намерение).
Ограниченный и фиксированный, заранее заложенный в бюджет оперативной памяти
Очень низкий, детерминированный
Да, для локального масштаба
