Hugging Face · 22 сентября 2026 г. · 1Cifer
Transformers теперь запускает модели llama.cpp
Hugging Face обновила библиотеку Transformers: теперь она умеет напрямую загружать и запускать модели в формате GGUF — том самом, что использует движок llama.cpp — без предварительной конвертации. Раньше для работы со сжатыми, или квантованными, версиями моделей нужно было либо ставить отдельный инструмент llama.cpp, либо вручную переводить веса модели в другой формат.
Квантование позволяет заметно уменьшить размер модели и объём нужной памяти, почти не теряя в качестве ответов — это один из главных способов запускать современные модели на обычных серверах, а не только на дорогих видеокартах. Объединение двух экосистем в одном инструменте убирает лишний технический шаг между появлением новой модели и её реальным использованием в продукте.
Если в компании уже пробуют локальные или закрытые ИИ-модели для внутренних задач, стоит спросить у ИТ-специалистов, поможет ли это обновление сократить расходы на оборудование или быстрее запустить пилот. Пока разработчики разбираются с форматами моделей, бизнесу это можно пропустить: в 1Cifer агент под каждую должность уже настроен и отвечает по данным компании без сборки инфраструктуры.


