Спросил у девяти нейросетей, где лечить зубы в Москве: 4941 ответ и очень странная механика
Ассистент на вопрос «где в Москве вылечить зуб» отвечает не ссылкой на поиск, а готовым списком клиник с адресами и ценами. Автор прогнал 549 бытовых запросов через девять моделей, получил 4941 ответ и разметил в них 94 клиники. Конкретная клиника названа в 91,7% ответов, но имя бренда даёт лишь 8,7% упоминаний — всё остальное приносят страницы. Одна клиника попала в ответы 1694 раза и ни разу не была названа по имени, а половина моделей в интернет вообще не заглядывает.
Внутри — разбор механики, таблицы по моделям и источникам и глава про то, где метод врёт.
Читать далее
👉 Data Science | Machinelearning [ru]
Ассистент на вопрос «где в Москве вылечить зуб» отвечает не ссылкой на поиск, а готовым списком клиник с адресами и ценами. Автор прогнал 549 бытовых запросов через девять моделей, получил 4941 ответ и разметил в них 94 клиники. Конкретная клиника названа в 91,7% ответов, но имя бренда даёт лишь 8,7% упоминаний — всё остальное приносят страницы. Одна клиника попала в ответы 1694 раза и ни разу не была названа по имени, а половина моделей в интернет вообще не заглядывает.
Внутри — разбор механики, таблицы по моделям и источникам и глава про то, где метод врёт.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2
А все-таки Qwen3.8-27B — думает меньше и быстрее, чем 3.6
В пятницу вышла Qwen3.8-27B. Автор рассказывает, что с середины мая сидит на локальной Qwen3.6, поэтому ему было интересно протестировать новинку.
На Хабре были статьи о том, что 3.8 слишком долго думает и много галлюцинирует (что автору кажется не совсем корректным), поэтому он поделился настройками, которые работают у него.
По его словам, Qwen3.8-27B превзошла ожидания, и «задумчивой» её никак не назвать.
Читать далее
👉 Data Science | Machinelearning [ru]
В пятницу вышла Qwen3.8-27B. Автор рассказывает, что с середины мая сидит на локальной Qwen3.6, поэтому ему было интересно протестировать новинку.
На Хабре были статьи о том, что 3.8 слишком долго думает и много галлюцинирует (что автору кажется не совсем корректным), поэтому он поделился настройками, которые работают у него.
По его словам, Qwen3.8-27B превзошла ожидания, и «задумчивой» её никак не назвать.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥3
[3/8] Context Ranking: как отобрать реально полезные куски из репозитория
Дальше по плану — как автодополнение вообще наскребает контекст для LLM. В живом репозитории потенциально полезного добра вагон и тележка, поэтому тупо искать куски с похожими словами — мимо. Надо еще выкупить, какие из них реально стоит показать модели.
Разбираем классику ранжирования — BM25: почему редкие идентификаторы ценнее популярных слов, зачем учитывать размер файла и почему десять одинаковых совпадений не должны быть в десять раз полезнее одного.
Читать заметку
👉 Data Science | Machinelearning [ru]
Дальше по плану — как автодополнение вообще наскребает контекст для LLM. В живом репозитории потенциально полезного добра вагон и тележка, поэтому тупо искать куски с похожими словами — мимо. Надо еще выкупить, какие из них реально стоит показать модели.
Разбираем классику ранжирования — BM25: почему редкие идентификаторы ценнее популярных слов, зачем учитывать размер файла и почему десять одинаковых совпадений не должны быть в десять раз полезнее одного.
Читать заметку
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Что в маркетинге и PR можно удешевить с помощью ИИ, а что трогать не стоит
ИИ меняет экономику маркетинга: работа, на которую уходили часы команды и подрядчиков, теперь делается за часы. Отсюда соблазн смотреть на маркетинг как на список затрат и резать людей, инструменты, исследования, контент.
Но маркетинг — это связанная система. Что-то можно убрать без последствий, а что-то кажется лишним ровно до тех пор, пока не начинают падать качество решений, знание клиента и рост. Правильный вопрос: не «что заменить на ИИ?», а «что можно удешевить, не разрушив систему?».
Читать далее
👉 Data Science | Machinelearning [ru]
ИИ меняет экономику маркетинга: работа, на которую уходили часы команды и подрядчиков, теперь делается за часы. Отсюда соблазн смотреть на маркетинг как на список затрат и резать людей, инструменты, исследования, контент.
Но маркетинг — это связанная система. Что-то можно убрать без последствий, а что-то кажется лишним ровно до тех пор, пока не начинают падать качество решений, знание клиента и рост. Правильный вопрос: не «что заменить на ИИ?», а «что можно удешевить, не разрушив систему?».
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
[Перевод] Три месяца с Claude: хороший ассистент, плохой программист
LLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу.
В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее.
Узнать подробнее
👉 Data Science | Machinelearning [ru]
LLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу.
В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее.
Узнать подробнее
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Долбил нейросеть одним и тем же вопросом три раза — и словил три разных списка компаний
Задолбал ИИ-поиск одним запросом трижды, ничего не меняя. Первый раз он выдал 9 фирм, второй — 12, третий — 7. Совпало между всеми попытками всего пять названий из пятнадцати. А первая и третья попытка вообще не пересекли ни одного сайта.
С таким разбросом любой отчёт вида «вас упоминают в 20% ответов», снятый одним заходом, — это лотерея. И «рост до 25% за месяц» — такая же лотерея. Внутри материала: как автор сам на этом обжёгся и публично отзывает свою цифру из прошлой статьи, что при такой волатильности вообще можно замерять, три вопроса исполнителю до оплаты и проверка на коленке за десять минут и ноль рублей.
Читать на Хабре
👉 Data Science | Machinelearning [ru]
Задолбал ИИ-поиск одним запросом трижды, ничего не меняя. Первый раз он выдал 9 фирм, второй — 12, третий — 7. Совпало между всеми попытками всего пять названий из пятнадцати. А первая и третья попытка вообще не пересекли ни одного сайта.
С таким разбросом любой отчёт вида «вас упоминают в 20% ответов», снятый одним заходом, — это лотерея. И «рост до 25% за месяц» — такая же лотерея. Внутри материала: как автор сам на этом обжёгся и публично отзывает свою цифру из прошлой статьи, что при такой волатильности вообще можно замерять, три вопроса исполнителю до оплаты и проверка на коленке за десять минут и ноль рублей.
Читать на Хабре
Please open Telegram to view this post
VIEW IN TELEGRAM
Claude вскрыл 16 SAML‑проектов за месяц вечеров. Чинить их оказалось некому
В Authentik — популярной опенсорсной системе корпоративного входа — независимо и почти одновременно нашли одну и ту же уязвимость
Об уязвимости сообщили восемь исследователей. Один из них — Эрик Чан (Eric Chiang), технический директор Oblique Security; для него эта находка стала одной из шестнадцати. Свою историю он рассказал в блоге 19 августа. Он считает, что желающих оказалось так много, потому что он не единственный, кто теперь взламывает с помощью ИИ.
Читать далее
👉 Data Science | Machinelearning [ru]
В Authentik — популярной опенсорсной системе корпоративного входа — независимо и почти одновременно нашли одну и ту же уязвимость
CVE-2026-57580. В поле NameID можно вставить XML‑комментарий, обрезать значение до чужого адреса и привязать к жертве подконтрольную атакующему учётную запись — подпись оставалась валидной. Проблема проявлялась не у всех: нужны определённые настройки сопоставления учётных записей, отличные от заданных по умолчанию. Исправление вышло в версиях 2026.2.6 и 2026.5.5.Об уязвимости сообщили восемь исследователей. Один из них — Эрик Чан (Eric Chiang), технический директор Oblique Security; для него эта находка стала одной из шестнадцати. Свою историю он рассказал в блоге 19 августа. Он считает, что желающих оказалось так много, потому что он не единственный, кто теперь взламывает с помощью ИИ.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM