🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://xn--r1a.website/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://xn--r1a.website/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://xn--r1a.website/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://xn--r1a.website/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://xn--r1a.website/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://xn--r1a.website/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://xn--r1a.website/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://xn--r1a.website/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://xn--r1a.website/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://xn--r1a.website/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://xn--r1a.website/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://xn--r1a.website/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
❤4🔥3👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Автор `uv` пришёл в OpenAI и сразу ускорил запуск Codex CLI примерно в 25 раз
Астрэл-гуру Rust, стоящий за одним из самых быстрых Python-инструментов
Результат - время холодного старта сократилось примерно в 25 раз.
На практике разница ощущается сразу: Codex теперь открывается практически мгновенно и субъективно стартует даже быстрее Pi и Claude Code.
Если CLI запускается десятки раз в день, даже несколько сотен миллисекунд быстро превращаются в раздражение.
https://x.com/Machinelearrn/status/2091103150014935526
Астрэл-гуру Rust, стоящий за одним из самых быстрых Python-инструментов
uv, после присоединения к OpenAI взялся за производительность Codex CLI.Результат - время холодного старта сократилось примерно в 25 раз.
На практике разница ощущается сразу: Codex теперь открывается практически мгновенно и субъективно стартует даже быстрее Pi и Claude Code.
Если CLI запускается десятки раз в день, даже несколько сотен миллисекунд быстро превращаются в раздражение.
https://x.com/Machinelearrn/status/2091103150014935526
❤14🔥8👍3🎉2
⚡️ Harness Engineering - полный курс на русском
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
👍5❤4🔥4
NVIDIA запустила Groq 3 LPX - отдельный ускоритель генерации токенов для платформы Vera Rubin
По данным NVIDIA, в бенчмарке Artificial Analysis система достигла 3400 output-токенов в секунду на Gemma 4 31B при контексте 100 000 токенов.
Компания называет это самым быстрым зафиксированным результатом для этой модели.
Также NVIDIA заявляет до 4x более быстрый отклик по сравнению с ближайшей альтернативной платформой - прежде всего для AI-агентов и других latency-sensitive нагрузок.
Первым облачным провайдером с Groq 3 LPX станет Nebius через Token Factory. Затем ускоритель появится и в инфраструктуре Groq.
https://x.com/nvidianewsroom/status/2091904293343252534
По данным NVIDIA, в бенчмарке Artificial Analysis система достигла 3400 output-токенов в секунду на Gemma 4 31B при контексте 100 000 токенов.
Компания называет это самым быстрым зафиксированным результатом для этой модели.
Также NVIDIA заявляет до 4x более быстрый отклик по сравнению с ближайшей альтернативной платформой - прежде всего для AI-агентов и других latency-sensitive нагрузок.
Первым облачным провайдером с Groq 3 LPX станет Nebius через Token Factory. Затем ускоритель появится и в инфраструктуре Groq.
https://x.com/nvidianewsroom/status/2091904293343252534
❤4👍4
🤖 Вышла uncensored-версия Ornith 1.5 35B
huihui-ai выпустили Huihui-Ornith-1.5-35B-A3B-abliterated — модифицированную версию модели
Что изменили:
* убраны встроенные ограничения модели;
* изменены только слои 11–29;
* базовая архитектура и остальные параметры сохранены.
Модель доступна на Hugging Face:
https://huggingface.co/huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated
Ещё один пример того, как open-source сообщество экспериментирует с поведением LLM и настройкой моделей под разные сценарии.
huihui-ai выпустили Huihui-Ornith-1.5-35B-A3B-abliterated — модифицированную версию модели
ornith-ai/Ornith-1.5-35B-A3B с применением abliteration.Что изменили:
* убраны встроенные ограничения модели;
* изменены только слои 11–29;
* базовая архитектура и остальные параметры сохранены.
Модель доступна на Hugging Face:
https://huggingface.co/huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated
Ещё один пример того, как open-source сообщество экспериментирует с поведением LLM и настройкой моделей под разные сценарии.
huggingface.co
huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👍5❤1👏1
⚡️ Для AI-агентов скорость инференса становится критичнее, чем для обычного чата
WSJ отмечает две главные вычислительные проблемы agentic AI:
* обработка огромного контекста
* генерация токенов с минимальной задержкой
Причина простая: один агентный сценарий может включать сотни последовательных inference-шагов. Даже небольшая задержка на каждом из них быстро складывается в минуты.
NVIDIA Groq 3 LPX как раз нацелен на эти миллисекунды:
* детерминированное планирование через компилятор
* 128 ГБ SRAM на стойку
* заранее спланированные передачи между чипами
* меньше накладных расходов на small-batch workloads
https://www.wsj.com/cio-journal/nvidias-groq-chip-will-shape-ai-agent-usability-b2e076cd
WSJ отмечает две главные вычислительные проблемы agentic AI:
* обработка огромного контекста
* генерация токенов с минимальной задержкой
Причина простая: один агентный сценарий может включать сотни последовательных inference-шагов. Даже небольшая задержка на каждом из них быстро складывается в минуты.
NVIDIA Groq 3 LPX как раз нацелен на эти миллисекунды:
* детерминированное планирование через компилятор
* 128 ГБ SRAM на стойку
* заранее спланированные передачи между чипами
* меньше накладных расходов на small-batch workloads
https://www.wsj.com/cio-journal/nvidias-groq-chip-will-shape-ai-agent-usability-b2e076cd
👍4❤3🔥3
🔥 AutoSaddler - автоматическая оптимизация harness для AI-агентов
Идея простая: модель сама анализирует неудачные запуски агента и переписывает prompts, tools, hooks и middleware.
Но ключевая проблема - улучшение на одном наборе задач легко ломает поведение на других.
AutoSaddler решает это через held-out development set:
- анализирует failed traces
- патчит harness как обычный код
- проверяет обновление на задачах, которых модель не видела при исправлении
- сохраняет патч только если он реально улучшает общую работу агента
Авторы показывают, что без такой проверки автоматическая оптимизация может в итоге дать результат хуже исходного hand-written harness.
Полезная идея для тех, кто вручную или через LLM тюнингует агентов: считать не только исправленные ошибки, но и новые регрессии.
https://arxiv.org/abs/2608.23041
Идея простая: модель сама анализирует неудачные запуски агента и переписывает prompts, tools, hooks и middleware.
Но ключевая проблема - улучшение на одном наборе задач легко ломает поведение на других.
AutoSaddler решает это через held-out development set:
- анализирует failed traces
- патчит harness как обычный код
- проверяет обновление на задачах, которых модель не видела при исправлении
- сохраняет патч только если он реально улучшает общую работу агента
Авторы показывают, что без такой проверки автоматическая оптимизация может в итоге дать результат хуже исходного hand-written harness.
Полезная идея для тех, кто вручную или через LLM тюнингует агентов: считать не только исправленные ошибки, но и новые регрессии.
https://arxiv.org/abs/2608.23041
❤6👍4🤔2
⚡️ GLM-5.3-Flash вышла в uncensored-версии с нативным FP8
OrcaRouter опубликовала модифицированные веса GLM-5.3-Flash - модели на 320B параметров, из которых активны 18B.
Главное:
- исходная block-FP8 точность
- без LoRA
- без jailbreak-промптов
- снижение отказов встроено прямо в веса
По их тестам:
MaliciousInstruct: 96% → 11% отказов
JailbreakBench: 93% → 12%
AdvBench: 97% → 15%
HarmBench: 93% → 18%
XSTest benign over-refusal: 2.4% → 0.4%
При этом отказ не исчезает полностью.
Авторы считают, что alignment в GLM-5.3-Flash может быть устроен сложнее, чем один линейный "refusal direction". Поэтому релиз интересен не только как uncensored-сборка, но и как материал для исследований interpretability, AI safety и механизмов отказа.
Weights:
https://huggingface.co/orcarouter/GLM-5.3-Flash-Uncensored-FP8
API:
https://orcarouter.ai/models/z-ai/glm-5.3-flash
GGUF, MLX и другие квантизации обещают позже.
Weights on Hugging Face: https://huggingface.co/orcarouter/GLM-5.3-Flash-Uncensored-FP8
API (official weight): https://orcarouter.ai/models/z-ai/glm-5.3-flash
OrcaRouter опубликовала модифицированные веса GLM-5.3-Flash - модели на 320B параметров, из которых активны 18B.
Главное:
- исходная block-FP8 точность
- без LoRA
- без jailbreak-промптов
- снижение отказов встроено прямо в веса
По их тестам:
MaliciousInstruct: 96% → 11% отказов
JailbreakBench: 93% → 12%
AdvBench: 97% → 15%
HarmBench: 93% → 18%
XSTest benign over-refusal: 2.4% → 0.4%
При этом отказ не исчезает полностью.
Авторы считают, что alignment в GLM-5.3-Flash может быть устроен сложнее, чем один линейный "refusal direction". Поэтому релиз интересен не только как uncensored-сборка, но и как материал для исследований interpretability, AI safety и механизмов отказа.
Weights:
https://huggingface.co/orcarouter/GLM-5.3-Flash-Uncensored-FP8
API:
https://orcarouter.ai/models/z-ai/glm-5.3-flash
GGUF, MLX и другие квантизации обещают позже.
Weights on Hugging Face: https://huggingface.co/orcarouter/GLM-5.3-Flash-Uncensored-FP8
API (official weight): https://orcarouter.ai/models/z-ai/glm-5.3-flash
🔥7👍5❤3🤯1
Forwarded from Machinelearning
4 сентября Народный банк Китая выпустит набор золотых и серебряных памятных монет серии «Научно-технологические инновации будущего (Искусственный интеллект)».
В наборе три монеты - одна золотая и две серебряные, обе имеют статус законного платежного средства.
Золотая весит 5 граммов, квадратная, со стороной 18 миллиметров. На реверсе изображены чипы, схема в форме мозга и нули с единицами.
Серебряные - по 15 граммов, на них лица, микросхемы, спиральные узоры, ключи и символы ИИ.
Номинал золотой монеты - 80 юаней
Чеканят набор два государственных монетных двора - Шанхайский и шэньчжэньский Guobao. Купить монеты можно будет в том числе онлайн.
Кстати, когда в марте собирали эскизы для этих монет, организаторы разрешили дизайнерам пользоваться ИИ как вспомогательным инструментом, но запретили сдавать откровенный нейрослоп.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤4
OpenAI массово закупает Mac mini и Mac Studio для обучения AI-агентов.
По данным The Information, компания уже приобрела десятки тысяч компьютеров Apple и пытается купить ещё.
Их используют для reinforcement learning моделей, которые учатся работать с компьютером: управлять интерфейсом, приложениями и выполнять действия как обычный пользователь.
Похоже, этот спрос уже заметен и в отчётности Apple.
Выручка Mac в июньском квартале достигла $10,3 млрд - рост на 29% год к году. Это быстрее, чем у любой другой категории Apple, по которой компания раскрыла динамику.
Mac всё заметнее превращается из обычного пользовательского компьютера в инфраструктуру для AI-разработки.
https://www.theinformation.com/articles/apple-stumbled-ai-hardware-success-mac
По данным The Information, компания уже приобрела десятки тысяч компьютеров Apple и пытается купить ещё.
Их используют для reinforcement learning моделей, которые учатся работать с компьютером: управлять интерфейсом, приложениями и выполнять действия как обычный пользователь.
Похоже, этот спрос уже заметен и в отчётности Apple.
Выручка Mac в июньском квартале достигла $10,3 млрд - рост на 29% год к году. Это быстрее, чем у любой другой категории Apple, по которой компания раскрыла динамику.
Mac всё заметнее превращается из обычного пользовательского компьютера в инфраструктуру для AI-разработки.
https://www.theinformation.com/articles/apple-stumbled-ai-hardware-success-mac
❤3👍3🔥3👎2
🔥 Deep Agents from Scratch 0 курс по созданию продвинутых AI-агентов с нуля
LangChain собрала 5 ноутбуков на LangGraph, где агент постепенно усложняется: от обычного ReAct-цикла до полноценного research-agent.
Что разбирают:
- базовый ReAct: reasoning + action
- планирование через TODO и статусы задач
- вынос контекста в виртуальную файловую систему
- чтение, запись и редактирование файлов
- делегирование задач sub-agents
- параллельная работа специализированных агентов
Хороший вариант для тех, кто хочет понять не только как вызвать готового агента, а как он реально устроен внутри.
MIT License.
https://github.com/langchain-ai/deep-agents-from-scratch
LangChain собрала 5 ноутбуков на LangGraph, где агент постепенно усложняется: от обычного ReAct-цикла до полноценного research-agent.
Что разбирают:
- базовый ReAct: reasoning + action
- планирование через TODO и статусы задач
- вынос контекста в виртуальную файловую систему
- чтение, запись и редактирование файлов
- делегирование задач sub-agents
- параллельная работа специализированных агентов
Хороший вариант для тех, кто хочет понять не только как вызвать готового агента, а как он реально устроен внутри.
MIT License.
https://github.com/langchain-ai/deep-agents-from-scratch
❤2👍2
От идеи до продакшна < 3 месяцев, менять государственные и бизнес процессы — ты готов ? 🚀
Прямо сейчас Сбер ищет NLP-специалиста в команду, которая внедряет передовые harness в масштабные процессы, создаёт мультиагентные сценарии, RAG для миллионов документов, OSINT/deep‑research.
Ты будешь работать с передовым LLM‑стеком: LangChain и LangGraph, vLLM и PEFT/LoRA, полным RAG‑стеком, Vector DB (Qdrant, Weaviate) и инфраструктурой на FastAPI, Pydantic и asyncio.
Попасть в команду можно за 1 день — если пройдёшь все этапы отбора на One Day Offer, который состоится уже 5 сентября.
Регистрируйся по ссылке — количество слотов стремительно уменьшается! 💚
Прямо сейчас Сбер ищет NLP-специалиста в команду, которая внедряет передовые harness в масштабные процессы, создаёт мультиагентные сценарии, RAG для миллионов документов, OSINT/deep‑research.
Ты будешь работать с передовым LLM‑стеком: LangChain и LangGraph, vLLM и PEFT/LoRA, полным RAG‑стеком, Vector DB (Qdrant, Weaviate) и инфраструктурой на FastAPI, Pydantic и asyncio.
Попасть в команду можно за 1 день — если пройдёшь все этапы отбора на One Day Offer, который состоится уже 5 сентября.
Регистрируйся по ссылке — количество слотов стремительно уменьшается! 💚
Forwarded from Machinelearning
Главное:
- Fable 5.1 заметно сильнее в кодинге, агентных задачах и исследованиях
- Terminal-Bench Science: 52,6% против 24,7% у Fable 5
типичные задачи стали примерно на 25% дешевле
в сложных агентных сценариях экономия может доходить до 45%
-Mythos 5.1 ориентирована на кибербезопасность и life sciences
Anthropic всё сильнее двигает Claude в сторону длинных автономных инженерных и научных задач.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3🔥3
Дообучить 8B-модель теперь можно локально даже на ноутбучной GPU с 4 ГБ VRAM.
Soup держит замороженные веса модели в оперативной памяти и по очереди загружает на GPU только один слой декодера.
За счёт этого пиковое потребление видеопамяти остаётся ниже 4 ГБ.
Заявленные результаты на RTX 3050:
- 3,32 ГБ VRAM в пике
- до 119,6 токена/с
- результат побитово совпадает с обычным запуском
- вся настройка через один YAML-файл
Идея простая: вместо попытки целиком уместить 8B-модель в видеопамять слои последовательно передаются между RAM и GPU.
https://github.com/MakazhanAlpamys/Soup
Soup держит замороженные веса модели в оперативной памяти и по очереди загружает на GPU только один слой декодера.
За счёт этого пиковое потребление видеопамяти остаётся ниже 4 ГБ.
Заявленные результаты на RTX 3050:
- 3,32 ГБ VRAM в пике
- до 119,6 токена/с
- результат побитово совпадает с обычным запуском
- вся настройка через один YAML-файл
Идея простая: вместо попытки целиком уместить 8B-модель в видеопамять слои последовательно передаются между RAM и GPU.
https://github.com/MakazhanAlpamys/Soup
🔥10❤6👍3
Ant Group открыла финансовую модель Ling-3.0-flash-Fin и новый бенчмарк FinFIRST
Ling-3.0-flash-Fin - это специализированная модель для реальных финансовых задач, а FinFIRST - бенчмарк, который проверяет не только финальный ответ, но и весь процесс исследования.
Что умеет модель:
- искать и проверять источники;
- анализировать отчётность;
- строить оценки и valuation-модели;
- обновлять сложные таблицы;
- готовить редактируемые финансовые отчёты;
- работать в приватных развёртываниях.
По архитектуре это 124B MoE, но на каждый токен активируется только 5.1B параметров. Контекст - около 256K.
После финансового дообучения её результат в AA Intelligence Index вырос с 38 до 41.
На FinFIRST модель набрала 82.45% по проверке источников, что выделяет её среди протестированных открытых моделей.
Сам FinFIRST включает 123 задачи, написанные экспертами, и оценивает их по 701 атомарному критерию: проверяются источники, определения, ход анализа и корректность вывода, а не только конечный ответ.
Модель:
https://modelscope.ai/models/inclusionAI/Ling-3.0-flash-Fin
Бенчмарк:
https://modelscope.ai/datasets/inclusionAI/FinFIRST
Ling-3.0-flash-Fin - это специализированная модель для реальных финансовых задач, а FinFIRST - бенчмарк, который проверяет не только финальный ответ, но и весь процесс исследования.
Что умеет модель:
- искать и проверять источники;
- анализировать отчётность;
- строить оценки и valuation-модели;
- обновлять сложные таблицы;
- готовить редактируемые финансовые отчёты;
- работать в приватных развёртываниях.
По архитектуре это 124B MoE, но на каждый токен активируется только 5.1B параметров. Контекст - около 256K.
После финансового дообучения её результат в AA Intelligence Index вырос с 38 до 41.
На FinFIRST модель набрала 82.45% по проверке источников, что выделяет её среди протестированных открытых моделей.
Сам FinFIRST включает 123 задачи, написанные экспертами, и оценивает их по 701 атомарному критерию: проверяются источники, определения, ход анализа и корректность вывода, а не только конечный ответ.
Модель:
https://modelscope.ai/models/inclusionAI/Ling-3.0-flash-Fin
Бенчмарк:
https://modelscope.ai/datasets/inclusionAI/FinFIRST
❤5👍2🔥1
LFM2.5-2.6B - компактная reasoning-модель всего на 2,6 млрд параметров, которую можно запускать даже на телефоне.
При этом её специально обучали под агентные задачи:
- планирование
- вызов инструментов
- многошаговые сценарии
- работа внутри агентных фреймворков
На этапе дообучения использовали agentic reinforcement learning прямо внутри реальных агентных окружений, включая OpenClaw и Hermes Agent.
Если уже пользуешься OpenRouter, попробовать модель можно буквально заменой имени:
То есть полноценную небольшую agentic-модель можно протестировать бесплатно и без тяжёлого локального железа.
https://openrouter.ai/liquid/lfm-2.5-2.6b:free
При этом её специально обучали под агентные задачи:
- планирование
- вызов инструментов
- многошаговые сценарии
- работа внутри агентных фреймворков
На этапе дообучения использовали agentic reinforcement learning прямо внутри реальных агентных окружений, включая OpenClaw и Hermes Agent.
Если уже пользуешься OpenRouter, попробовать модель можно буквально заменой имени:
liquid/lfm-2.5-2.6b:freeТо есть полноценную небольшую agentic-модель можно протестировать бесплатно и без тяжёлого локального железа.
https://openrouter.ai/liquid/lfm-2.5-2.6b:free
👍6