283K subscribers
5.36K photos
1.24K videos
17 files
5.7K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
🌟 Turbovec: библиотека векторного поиска на основе гугловского TurboQuant

Библиотека написана на Rust, есть привязки для Python, а в основе - TurboQuant, алгоритм сжатия векторов, который Google описали в статье, принятой на ICLR 2026.

Сама библиотека к Google отношения не имеет, это независимая реализация чужого алгоритма.


🟡Turbovec сжимает данные примерно в восемь раз

Коллекция из 10 миллионов документов, занимающая в исходном виде 31 гигабайт, умещается в 4. Поиск при этом, как утверждает автор, идёт быстрее, чем в FAISS - одного из самых распространённых инструментов в этой области.

По замерам turbovec обгоняет FAISS в среднем в 3,4-3,5 раза при 4-битном сжатии и на 20-26% при 2-битном, в зависимости от железа.

🟡Удобные мелочи

Индекс не нужно предварительно обучать - векторы просто добавляются по мере поступления.

Сохранение инкрементальное, на диск уходит только то, что изменилось с прошлого раза, поэтому даже на большом индексе это занимает миллисекунды.

Поиску можно передать список разрешённых документов - скажем, чтобы пользователь видел только свои файлы.

Удаление работает по постоянным идентификаторам, ссылки на записи не плывут.

Тем, кто уже сидит на LangChain, LlamaIndex, Haystack или Agno, автор предлагает готовые адаптеры - меняется одна строка импорта, остальной код остаётся как был.


📌Лицензирование: MIT License


🖥 Github


@ai_machinelearning_big_data

#AI #ML #VectorSearch #TurboQuant #Rust
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍130🔥42🤓189👏8❤‍🔥6🎉3🥱1