Liquid AI выпускает две облегченные модели кодировщиков, которые быстро читают длинные документы, даже на ноутбуке

LFM2.5-Encoder-230M и LFM2.5-Encoder-350M могут просканировать весь контракт менее чем за 30 секунд на обычном компьютерном оборудовании, без специализированных микросхем.

AI2Day Newsdesk4 min read
A wide 16:9 editorial photograph of an empty glass-walled boardroom at dusk, chairs pulled back from a long table, city lights blurring softly through floor-to-
Share

Ключевые моменты

  • Liquid AI выпустила две модели кодировщиков, LFM2.5-Encoder-230M и LFM2.5-Encoder-350M, на Hugging Face в неуказанную дату в 2026 году.
  • Меньшая модель 230M работает примерно в 3,7 раза быстрее сравнимой модели ModernBERT-base на стандартном процессоре ноутбука при обработке длинных входных данных.
  • Обе модели обрабатывают до 8 192 токенов, примерно от шести до восьми страниц плотного текста, за один проход.
  • LFM2.5-Encoder-350M заняла четвертое место из 14 протестированных моделей, уступив только моделям, которые в десять раз больше по размеру.
  • Обе модели имеют открытые веса и бесплатны для загрузки из Hugging Face сегодня.

Liquid AI, компания из Бостона, выпустила две новые модели кодировщиков — тип моделей ИИ, которые читают и понимают текст, а не генерируют его с нуля. Модели называются LFM2.5-Encoder-230M и LFM2.5-Encoder-350M, и они уже доступны на Hugging Face, платформе с открытым исходным кодом, где исследователи и разработчики делятся моделями.

Если вы никогда не слышали о кодировщике, подумайте об этом так. Чат-бот вроде ChatGPT пишет новые предложения слово за словом. Кодировщик делает противоположное: он читает текст и определяет его значение — помечает ли он письмо как спам, выявляет ли персональные данные в документе или маршрутизирует запрос клиента в нужный отдел. Компании выполняют эти задачи постоянно, весь день, что делает скорость и стоимость решающими факторами.

Почему запуск на процессоре ноутбука имеет значение?

Большинство передовых моделей ИИ требуют дорогостоящих специализированных микросхем, называемых GPU, для работы с полезной скоростью. Эти кодировщики не требуют. На обычном процессоре ноутбука модель 230M обрабатывает полный документ из 8 192 токенов, примерно от шести до восьми страниц текста, примерно за 28 секунд. Ближайшая конкурирующая модель, ModernBERT-base, требует более 90 секунд на том же оборудовании для той же длины.

Разница в скорости в 3,7 раза — это основное заявление, и оно больше всего влияет на небольшие команды или компании, которые не хотят платить за облачные GPU для работы классификации.

Насколько хороши результаты?

Скорость мало значит без точности. Liquid AI протестировала обе модели на 17 задачах из GLUE и SuperGLUE, двух стандартных наборов тестов, которые исследователи используют для оценки того, насколько хорошо модель понимает язык. Из 14 моделей в сравнении LFM2.5-Encoder-350M заняла четвертое место. Каждая модель перед ней была больше, включая одну, которая была почти в десять раз больше по размеру с 3,5 миллиардами параметров.

Меньшая модель 230M превзошла ModernBERT-base и все варианты EuroBERT, несмотря на то, что физически меньше большинства из них.

Модель Параметры Рейтинг GLUE/SuperGLUE
LFM2.5-Encoder-350M 350M 4-е из 14
LFM2.5-Encoder-230M 230M превосходит ModernBERT-base
ModernBERT-base ~149M ниже обеих моделей LFM2.5

Что кто-то может на самом деле построить с этим?

Liquid AI перечисляет несколько готовых демонстраций: инструмент, который обнаруживает и удаляет 40 типов персональной информации на 16 языках, проверку политик, которая сканирует текст на соответствие правилам компании, написанным на простом английском языке, и маршрутизатор подсказок, который автоматически отправляет запросы пользователей в нужный сервис. Все демонстрации работают в браузере без настройки.

Разработчики также могут загрузить любую модель и адаптировать ее к определенной задаче, процесс, называемый тонкой настройкой, используя стандартные инструменты Hugging Face. Liquid AI опубликовала учебное пособие, которое проходит через этот процесс по длинным юридическим документам.

Часто задаваемые вопросы

Нужен ли мне мощный компьютер для использования этих моделей?

Нет. Обе модели разработаны для работы на стандартном процессоре ноутбука или сервера. Вам не нужен GPU, хотя его использование сделает их еще быстрее на более коротких документах.

Бесплатны ли эти модели в использовании?

Да. Обе модели LFM2.5-Encoder-230M и LFM2.5-Encoder-350M имеют открытые веса, что означает, что любой может загрузить и использовать их бесплатно, включая коммерческие проекты, в соответствии с условиями лицензии на Hugging Face.

Какой размер мне выбрать?

Собственные рекомендации Liquid AI ясны: выбирайте модель 350M, когда точность является приоритетом, и модель 230M, когда вам нужно обрабатывать больше документов в час или ваше оборудование ограничено.

© 2026 AI2Day