Инженер Контекста
930 subscribers
597 photos
47 videos
4 files
1.98K links
Евгений Левашов, контент-лид в VK Tech, отвечаю за VK Cloud, VK Data Platform, Tarantool и другой технохардкор. Редактирую ИТ-компании, консультирую, учу. Здесь всё про Ai в контенте, дату, облака и остальной ИТ.

Писать — @levashove

CC BY-NC-SA 4.0
Download Telegram
Инженер Контекста
Хочу выкладывать отдельные скиллы в опенсорс
Как и обещал, а вы голосовали, скилл aeo-trust-blocks для аудита и переработки текста под AI-выдачу. Проверяет, насколько безопасно ИИ-поисковикам (ChatGPT, Perplexity, Google AI Overviews, Яндекс Нейро) цитировать ваш контент, и переписывает слабые места в самодостаточные блоки доверия — Extractable Trust Blocks.

Что внутри:

➡️ Аудит cite-safety — каждый блок текста оценивается по шкале 0–10 (извлекаемость, прямой ответ, фактологичность, структура, объём, имплицитные ссылки, нейтральность);
➡️ чек-лист самодостаточности и каталог «слепых зон контекста»;
➡️ формула Trust Block: [Утверждение] → [Объяснение] → [Граница применимости] → [Пример/Источник] и 6 типов блоков под разные интенты (answer capsule, fact block, comparison, how-to, definition, key takeaway);
➡️ замены «размыто → конкретно» («быстрое внедрение» → «внедрение за 2–4 часа»);
➡️ безопасная JSON-LD-разметка (Article, FAQPage, Organization) без нарушения structured data policies;
➡️ контракт с голосом канала: что переводить в ETB, а что оставить живым;
➡️ защита фактуры: цифры, цитаты и атрибуции при переработке не меняются.

Результат — таблица аудита (фрагмент → проблемы → переработанный блок → как повышен cite-safety) и итоговый Cite-Safety Score до/после.

📌 GitHub📌

Следующий скилл на тысяче подписчиков, что на моём скучном контенте выглядит не очень реальным. 😂

#ai_skills #ai
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥2🔥2
Не по теме канала, но лучшее по колобку
😁5
Не по теме канала, но закат в Филинской бухте
8
Ассистенты расходятся не на проценты, а принципиально

Месяц назад по отчёту Similarweb я писал, что ИИ-поиск фрагментируется: доля ChatGPT в вебе просела с ~76% до ~53%, Gemini подобрал разницу. Открытым остался вопрос: расхождение между ассистентами — это разница в оттенках или разные ответы? Появились цифры — это разные ответы.

Вышел AI Software Index 2026: 126 категорий софта, 1825 брендов, 9978 ответов (5023 у ChatGPT, 4955 у Gemini). Около 80 покупательских формулировок на категорию — «какая CRM лучше для малого бизнеса», «я фрилансер, нужен биллинг». Собирали 6 августа в живых веб-приложениях, а не через API.

В каждой третьей категории два ассистента называют разный продукт №1.

Что ещё в цифрах:

→ ChatGPT, рекомендуя продукт, в 53% случаев ссылается на сайт самого продукта. Gemini — в 13%, остальное тянет со сторонних страниц, часто из блогов других софтверных компаний.
→ Один и тот же бренд забирает от 34% до 90% ответов в зависимости от того, сказал покупатель «я фрилансер» или «мы энтерпрайз».
→ Британская и американская формулировка одного вопроса меняют лидера примерно в половине измеримых категорий.
→ Присутствие ≠ победа: HubSpot в 19 лидербордах — три победы. Salesforce: 13 и ноль. QuickBooks: 7 и пять.
→ Где-то ответ забетонирован: GitHub первый в 91% ответов про CI/CD, Shopify — в 84% про e-commerce, Miro — в 83% про доски.

Дисклеймер: индекс выпустила GetIntel, которая продаёт мониторинг ИИ-видимости бренда. Исследование ровно про ту проблему, которую она монетизирует. Методология самопубликуемая, срез однодневный, «победа» = первый упомянутый в ответе бренд.


Что с этим делать

Разрыв 53% против 13% — это две разные задачи, а не одна. Для ChatGPT ваш сайт и есть источник: документация, сравнения, цены, сценарии. Вопрос только в том, есть ли там что вынуть. Для Gemini вашего сайта почти не существует, работает то, что о вас написали снаружи.

Каталоги отзывов на этом фоне выглядят бледно: 5% на троих против отраслевых медиа и живых обсуждений.
Ответ собирается под роль покупателя. Разброс от 34% до 90% значит, что нужны страницы и абзацы, где роль названа его словами, а не вашими сегментами из презентации.

И поправка к тому, что я советовал в прошлый раз. Я предлагал прогонять 20–30 запросов в месяц и вести реестр упоминаний. Этого мало. Когда одна смена роли двигает бренд на 56 пунктов, тридцать запросов дадут красивое, но случайное число. Мерить надо матрицей: базовая формулировка × роль × локаль. И смотреть не среднее, а размах. Большой размах означает, что позиции у вас нет — есть лотерея. И чинится это не подгонкой под ответ, а плотностью и извлекаемостью того, что модель о вас находит.

Под извлекаемость я недавно выкладывал скилл aeo-trust-blocks: аудит cite-safety и переработка текста в самодостаточные блоки. Индекс объясняет, зачем он нужен. В половине случаев ChatGPT подтверждает рекомендацию вашей же страницей. Если на ней нечего процитировать — подтверждать нечем.

#geo #ai
❤‍🔥1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Это видео для тех, кто много работает и пропустил солнечное затмение 🌞🌝
🌚1
Контент Claude теперь помечен. И это не новость про списывающих студентов

11 августа Anthropic подтвердила, что маркирует контент, который создают с помощью их моделей. Не видимой плашкой, а маркерами внутри . На следующий день TechCrunch вышел с материалом о том, как на это реагируют в реддите: заголовок про пользователей, которые злятся, потому что их поймают на работе и на учёбе. Но интереснее реакций механика.

Что сделали:

— причина - кодекс прозрачности в рамках EU AI Act, вступил в силу 2 августа. Требует помечать сгенерированный или отредактированный ИИ контент так, чтобы метку читали другие системы. Подписанты не только Anthropic.
— все модели, вышедшие после 2 августа, метят и текст, и файлы. Для файлов — открытый стандарт C2PA.
— метка ставится на уровне модели. То есть она есть везде, откуда бы текст ни вышел: API, чат, Claude Code, Cowork, Tag.
— метка едет вместе с текстом при копировании и, по формулировке справки, может пережить часть правок. Сколько правок её снимают не уточняется.
— на старые модели поддержку обещают дораскатить.

Претензии делятся на две неравные части. Одна честная: модели учили на чужих текстах, никого не спрашивая, а теперь метят своё. Ирония тут есть. Вторая сводится к «меня поймают», но подаётся как защита невинных: студент, попросивший переставить абзац, журналист, попросивший конспект стенограммы. Только конспект с меткой становится проблемой ровно в одном случае: если его вставляют в статью как свой текст. Тогда проблема не в метке. Показательно, что в тех же тредах большинство комментаторов встало на сторону маркировки.

Что меняется у редакции

Предупреждать, что вы генерируете с помощью ИИ перестало быть вашим решением. Раньше «говорить ли заказчику, что черновик собрал агент» было вопросом договорённостей и совести. Теперь это свойство файла. Вопрос только в том, узнает заказчик об этом от вас или без вас.

Стилевые детекторы съезжают на второй план. Я рассказывал про свой слой проверок на GitHub Actions — там среди прочего скрипт считает плотность тире и ищет следы машинного текста. Это эвристика, она угадывает по стилю. Метка не угадывает, она в источнике. Значит, такие детекторы перестают быть ответом на вопрос «писал ли это ИИ» и остаются тем, чем и должны быть, — проверкой качества, а не происхождения.

Асимметрия, которую легко упустить. Наличие метки — сильное свидетельство. Отсутствие не значит ничего: метят не все и не везде, старые модели дораскатывают, локальные модели никто не обязывает. Любая проверка сотрудников или студентов «на ИИ» по этому принципу будет ловить одних и пропускать других. Строить такие процедуры начнут уже осенью, а границы у метки пока нет.

И к тому, о чём уже писал

В манифесте контент-опса у меня стояла строчка: ответственность за выпущенное важнее скорости выпуска. Тогда это была позиция. Теперь у неё появился технический носитель — происхождение едет вместе с текстом и доезжает до читателя.

А ещё я обещал развернуть content sec ops. Вот его первый слой, и он не про доступы агента к базе знаний, а про провенанс: знаем ли мы, что именно в материале сгенерировано, зафиксировано ли это где-то помимо головы редактора, и что мы отвечаем, когда спросят. Редакция с логом пайплайна ответит за минуту. Таких пока мало.

Что имеет смысл сделать на этой неделе: записать в редполитику, где вы используете генерацию и что сообщаете об этом клиенту. Одна страница, до того как вопрос прилетит снаружи.

#ai #contentops
🔥2🤔1
В календари: комьюнити‑конференция Kuber Conf от АОТ пройдёт 22 октября. Будем говорить про экономику платформ и облачные технологии для AI.

АОТ — это VK Cloud, Yandex Cloud и Флант.

Подробности на Хабре.
🙏1
Пятница, дамы и господа.
🔥5
This media is not supported in your browser
VIEW IN TELEGRAM
Не забывайте классику! Только надо еще про «сделай нейросетью» добавить.
😁41🔥1🙏1
Прочитал у Базы, что в Москве разработчика заподозрили в прохождении собеседования с помощью ИИ. И теперь СБ, как там написано "крупной ИТ-компании", на полном серьёзе присылает список вопросов, среди которых есть "знакомы ли Вам программы Codex и ShadowHint".

Интересно, как можно в августе 2026 года разработчику не знать, что такое Codex? И что это за ИТ-компания такая, что не пользуется тем, о чём спрашивает.
При этом логику безопасников я понимаю. Собеседование — проверка человека, а не его подписок. Если кандидат сидит с суфлёром в оверлее, вы нанимаете не инженера, а чужой инференс с задержкой в полсекунды. Это честная проблема, и она реально выросла за последний год. А если он ещё и использует ИИ вне контура и без разрешения, сливая туда код, то это уже прямая дыра в ИБ.

Но кажется, что разработка без ИИ в 2026 — это не безопасность, это утопия. Причём утопия задним числом: она описывает мир, которого уже нет, и предлагает нанимать людей, как будто он ещё есть.

То есть при найме должны быть другие вопросы уже. Не ответь на базовые вопросы, а объясни, что вот эта штука делает, и почему ты оставил её именно так. Тридцать минут разговора по чужому коду закроют вопрос понимания профпригодности человека. В собеседованиях на контентные позиции такая же проблема, кстати. Просить написать текст уже кажется очень глупой задачей на тестовое.

А при работе запрещать ИИ, потому что ИБ. Ну удачи... Это как запрещать пользоваться смартфоном уже.

Короче, любопытный кейс. Интересно, напишут ли чем закончилась проверка.
🔥2😁1
Проверка, которую агент не может пропустить

Готовил доклад про контроль качества в своей фабрике агентов и поймал себя на мысли: самый недооценённый слой в ней — хуки. Про промпты пишут все, про хуки почти никто.

Проблема, из которой они выросли. Долго все мои проверки жили в промптах: правила в контексте, субагент-фактчекер, редакторская вычитка. Они работают, но у этого доверия есть слепое пятно: проверка случается, если агент про неё «вспомнил», если правило доехало до контекста. А когда не сработало, узнаёшь уже на вычитке.

Хук устроен иначе. Это скрипт, который среда запускает сама на событие. Агент его не вызывает, а значит не может забыть, пропустить или уговорить себя, что в этот раз можно без проверки.

Что у меня стоит на хуках:

→ Записал файл — запустился линтер. Невидимые Unicode-символы, самоидентификация модели в тексте: запись возвращается агенту с текстом ошибки, и он сам переписывает файл. Человека в этом цикле нет вообще.
→ Завершение хода: анонсировал — приложи. Модель любит написать «запускаю фактчекера» и не запустить: слова есть, работы нет. Хук проверяет, что за словами стоит реальный вызов.
→ Перед веб-поиском хук сверяется с кэшем исследований. Если то же самое уже искали, агент в сеть не идёт. Это уже не про качество, а про деньги, но механика та же.

И одно правило, без которого всё это умирает: при собственном сбое хук обязан пропустить работу дальше и ничего не блокировать.

Главное отличие от проверок в промптах сформулирую так: промпт — это просьба, хук — это физика. Раньше на вопрос «а точно ли всё проверилось» отвечала моя вера в процесс. Теперь отвечает сам процесс.

#ai_agents #contentops
12👍2🔥1🤔1
Давно хотел ввести новую более менее постоянную рубрику про полезные плагины — #ai_plugin

Начнём с максимально полезного — diagram-design — это новое дополнение к Claude Code, Codex и Pi. Уже 3,3 тысячи звёзд на GitHub, раздаётся бесплатно, лицензия MIT.

Что оно умеет

38 видов схем. Есть таймлайн, воронка, пирамида, квадрант «важность / трудозатраты», оргструктура, диаграмма Венна, столбики, линии, Гант. Всё, что обычно нужно в статье, лендинге или презентации.

Каждая схема — в трёх версиях: светлая, тёмная и «журнальная» с подписями-карточками. Файл открывается в браузере без установки чего-либо ещё и выгружается в PNG или SVG. Можно унести в статью, в слайды или отдать дизайнеру.

Главное — подстройка под ваш стиль

Пишете: «возьми фирменный стиль с такого-то сайта». Инструмент открывает главную страницу, находит цвета и шрифты, показывает, что предлагает применить, и ждёт вашего «да». Фон сайта становится фоном схемы, цвет кнопки — цветом акцента, ваш основной шрифт — шрифтом подписей.

Заодно проверяет читаемость: если фирменный цвет на мелком тексте плохо виден, предлагает подправить и объясняет, почему.

И приятная мелочь: при первом запуске в новом проекте он останавливается и спрашивает — настроить стиль или рисовать в дефолтном. Молча выдать безликую картинку не даст.

Автор зашила свой редстандарт: один акцентный цвет, один-два элемента, на которые читатель должен посмотреть первыми, тонкие линии, никаких теней. Целевая плотность — 4 из 10. Принцип: каждый блок должен заслужить своё место.
1🔥2👍1🤔1
DeepSeek открыл свой харнесс. За неделю вокруг него собрался каталог из 97 плагинов

Сначала база, потому что «харнесс» стало жаргоном, а объясняют его редко.

Модель — это функция «текст → текст». Она не умеет читать ваш репозиторий, запускать тесты, разбирать чужой стектрейс, откатываться после падения и продолжать работу на сороковом шаге. Всё это делает обвязка: агентный цикл, набор инструментов, системные промпты, права доступа, компакция контекста, песочница, логирование. Это и есть харнесс. Claude Code — харнесс. Модель — мозг, харнесс — руки, глаза и правила игры.

Отсюда следствие: цифра на агентном бенчмарке — это результат связки модель+харнесс, а не только свойство модели.

13 августа DeepSeek выложил Harness v0.1 в developer preview. MIT, пакет @deepseek-ai/dsh в npm, запуск одной строкой, веб-морда на 127.0.0.1:3080. За двое суток — больше 95 тысяч звёзд.

Как устроено

Главный принцип — «всё есть плагин». В обычном агенте ядро зашито: разработчики решили, какая модель, какие инструменты, как выглядит интерфейс, — а вы дописываете что-то по краям. Здесь сменное всё: модель, инструменты, скиллы, сессии, песочница, работа с файлами, сам цикл агента и интерфейс. Меняется конфигом, лезть в исходники не надо. Ставите и снимаете плагины на ходу, без перезапуска и без мусора после них — за это отвечает Cordis, микроядро под капотом.

Работать можно в четырёх режимах. Standard — обычный полноценный агент. Minimal — всего два инструмента, режим для замеров на бенчмарках. Creator — чтобы собрать свою сборку. И Code — самый любопытный.

Про Code стоит объяснить отдельно. Обычно агент дёргает инструменты по одному, и результат каждого целиком уезжает в контекст. Поиск нашёл сорок файлов — все сорок путей в контексте. Прочитали эти сорок файлов — ещё сорок портянок текста, которые модель перечитывает на каждом шаге. В Code-режиме модель вместо этого пишет маленькую программу, харнесс запускает её целиком, и назад приходит только итог — три строки вместо восьмидесяти простыней. Экономия контекста огромная. Минус — программу надо написать без ошибок с первого раза: если ошибётся, упадёт вся, а не один шаг.

И третье — всё пишется. Правило простое: что увидела модель, то и записано. В лог попадают промпты, рассуждения, вызовы инструментов и их результаты, каждая подгрузка контекста. Из этой записи можно продолжить сессию, ответвиться от любой точки, найти нужный момент и проиграть заново. Кто хоть раз пытался понять, почему агент на тридцатом шаге снёс тесты, оценит.

Что произошло за неделю

Появился каталог того, что успели написать под dsh. 97 плагинов, CC0, семь категорий, свой сайт и бейдж. У самого каталога 54 звезды — это ещё заявка на роль справочника, не справочник. И читать «97 плагинов» как «97 независимых авторов» не стоит: больше трети позиций — репозитории одной организации, omdsh-dev.
Показательно, за что взялись в первую очередь. Три плагина решают одну проблему — контекст:

dsh-context-doctor — аудит инъекций, токен-стоимость цепочек инструкций, каталогов скиллов и схем инструментов, детект дублей и конфликтов
dsh-tool-search — выдача схем инструментов по требованию вместо загрузки всех сразу
dsh-agent-budget — бюджет токенов на дерево агентов

И самый интересный плагин в списке: dsh-chat-import — тянет истории из Claude Code, Codex, ChatGPT и Cursor и превращает их в возобновляемые сессии dsh. Экосистема прекрасно понимает, откуда приходят люди.

Прежде чем идти ставить
Отбора в каталоге нет: пул-реквест — это одна строка в двух README, английском и китайском. Ни ревью качества, ни аудита безопасности. При том что часть плагинов лезет в файловую систему, в базы и в управление компьютером. Кстати, искать плагины можно и мимо каталога — по тегу dsh-plugin.
Сам харнесс — v0.1, и в README капслоком обещаны ломающие изменения. Писать плагин под dsh сегодня — не «поставил и забыл», а подписка на чужой рефакторинг.

Подробный разбор архитектуры и таблица по всем лабам, у которых уже есть свой харнесс, — есть на Хабре.

#ai #ai_plugin
👍1🆒1
На Хабре вышла статья коллеги о том, как развернуть локальный ИИ-агент в своём контуре — Ollama плюс OpenClaw. Рабочая инструкция, пользуйтесь.

#ai_agents #habr
👍2
Дело не в гуманитариях, а в конфигурации задачи. Или размышления о том, как внедрять ИИ в редакциях.

Давайте не про агенты, а про процессы. На митапе для редакторов в IT от YADRO я очень коротко рассказывал про то, как улучшить качество материалов, которые мы получаем от ИИ. И сам в процессе понял, что тема интересна даже не механиками, а психологией. Ведь я долго объяснял сопротивление ИИ у редакторов складом ума. Технари любят новое, гуманитарии, коих среди коллег большинство, держатся за ремесло. Удобная рамка, все кивают.

Рамка неверная. Я видел, как в её тени принимаются решения: «наймём тех, кто помоложе», «проведём воркшоп, они привыкнут». Не привыкают. Потому что сопротивление растёт не из склада ума, а из конфигурации задачи. Условий три, и у редакторов совпадают все три сразу.

Первое. Задача выглядит субъективной

Текст — это вкусовщина. Так его видит редактор, и не без оснований: он не может объяснить, почему эта фраза плохая, он её слышит. Там, где нет проверяемого критерия, доверять алгоритму не за что. Нечем поверить его выход.

Тут ловушка в слове «выглядит». Внутри редактуры полно вполне объективных кусков: факт сходится с источником или нет, термин единообразен или нет, структура соблюдена или нет. Но они не отделены, поэтому весь процесс окрашивается субъективным. Мы сами склеили проверяемое с непроверяемым и потом удивляемся, что доверие не выдаётся частями.

Второе. У человека есть экспертиза именно здесь

Десять лет практики, свёрнутые в интуицию. Это капитал, и он работает: редактор правит быстро и точно, не проговаривая ни одного правила.

Он же главное препятствие. Эксперт вообще плохо принимает советы, любые, не только машинные. Попробуйте предложить сильному редактору правку от другого сильного редактора И увидите ту же реакцию, что и на нейросеть. Просто человеку мы такое прощаем, а модели нет.

Третье. Модель спорит с твоим суждением, а не с чужим

Вот это самое недооценённое. Разница между «вот вариант коллеги, сравни со своим» и «вот вариант вместо твоего» кажется формальной. Она не формальная.


Почти все внедрения устроены по второй схеме. Модель отдаёт готовый текст, человек ставит оценку. То есть каждый раз ставится вопрос «ты или она», и каждый раз человек защищает себя. Мы буквально спроектировали процесс так, чтобы включалась самозащита, а потом называем результат технофобией.

Проверка на технарях

Если бы дело было в гуманитарной природе, разработчики принимали бы ИИ гладко. Не принимают.
Сеньор, который десять лет живёт в своей кодовой базе, тормозит ровно так же. У него та же тройка: качество кода он оценивает по неписаному стандарту, экспертизы вагон, и ассистент предлагает вместо его решения. Разница только в том, что он реже говорит об этом вслух — не принято.

Это, кстати, лучший аргумент в разговоре с руководством. Как только «наши редакторы боятся нового» превращается в «у наших редакторов совпали три условия, и у наших сеньоров они тоже совпали» — разговор переезжает с людей на процесс. А чинить процесс можно.

Что делать по каждому пункту

Расщепить задачу. Вытащить из «редактуры» то, что проверяемо, и назвать это отдельно. Редполитика в файле: что считается фактом, откуда берутся цифры, какие конструкции запрещены, что делаем с вендорскими заявлениями. Это больно, так как впервые заставляет команду проговорить то, о чём она молчаливо договорилась. Зато появляется предмет спора: критерий, а не вкус. И спорить начинают редакторы между собой, а не редактор с нейросетью.

Дать право править. Разница между «принять или отклонить» и «вмешаться внутрь» больше, чем кажется. В первом случае человек оценивает чужой результат целиком и потому придирается к целому. Поэтому одна кривая фраза хоронит нормальный текст, отправляя его на перегенерацию. Во втором он эту фразу просто переписывает и идёт дальше. Причём объём вмешательства почти не важен: достаточно, чтобы возможность править существовала. И вот что из этого следует. Чем плотнее вы закрываете процесс — «модель сама всё сделает, вам останется утвердить», — тем больше сопротивления получите на входе. Не потому что качество хуже, а потому что человеку не оставили места. Пайплайн, где нельзя ничего подкрутить, будет отвергнут скорее, чем пайплайн, который иногда выдаёт ерунду, которую можно поправить.

Поставить рядом, а не вместо. Обычная схема: редактор жмёт кнопку, получает готовый текст и ставит «ок» или «переделать». Но это не помощь, а экзамен, где экзаменуют его самого: свой вариант у него уже есть в голове, и принять чужой значит признать, что его был хуже. Он защищает себя, а не оценивает текст. Переставьте два шага: сначала свой заголовок, потом ещё три от модели — и он уже не сдаёт экзамен, а выбирает из четырёх, один из которых его. Отсюда три правила, и все они про то, кто в процессе автор:

1. Модель работает в начале, а не в конце: даёт сырьё — конспекты и черновики, — а не финал на утверждение, потому что чужой финал тяжело судить и хочется зарубить целиком, а из сырья просто собирают.
2. Вариантов всегда несколько: один — это закрытый вопрос «да или нет», где отказ стоит дорого, а три — открытый «какой», и даже слабые варианты работают, на их фоне видно, чем хорош сильный.
3. И своя версия появляется первой. Стоит один раз прочитать вариант модели и мысль уже не своя: дальше вы либо соглашаетесь с ним, либо спорите, но в обоих случаях думаете про её текст, а не про свой. Собственная идея просто не успевает родиться. Поэтому сначала набросайте свой заголовок — хоть кривой, хоть за тридцать секунд, — и только потом смотрите, что предложила модель.

Что не чинится

Под материалом стоит фамилия человека. Не модели. Пока это так, редактор будет проверять, и правильно сделает. Задача не в том, чтобы он перестал проверять, а в том, чтобы проверка стоила дешевле, чем написать самому.

И тут уже можно возвращаться к тому, о чём я рассказывал на митапе и рассказываю в канале. Но начинать, конечно, лучше вот с вышеописанных решений и договорённостей.

#контентменеджерское
1🔥31🤯1🆒1
«Что сейчас самое лучшее?» — неправильный вопрос

Давайте сегодня не про технину и агентов опять. Я начал со сложного и пропустил самое начало, а спрашивают как раз про него. С чего начать, что сейчас на острие, какая модель лучше, пора ли переезжать.
Отвечу сначала как спросили. Потом объясню, почему спросили не то.

По существу вопроса: берите то, что подходит вам, а не то, что вышло вчера.

Инструмент, в котором вы работаете каждый день, окупается не характеристиками, а наработанностью. Вы знаете, где он врёт. Знаете, какая формулировка даёт результат. У вас накопились заготовки, шаблоны, контекст. Это капитал, и переносится он плохо: на новом инструменте вы снова новичок, только теперь с завышенными ожиданиями. Три месяца притирки ради пятнадцати процентов на бенчмарке — плохая сделка.

А переезжают именно ради процентов на бенчмарке. Хотя бенчмарк меряет не вашу работу. Модель, которая решает олимпиадную математику, не обязательно держит ваш тон голоса. Победитель агентных задач не обязательно аккуратнее с фактами. Единственный честный тест — десять ваших типовых задач через оба варианта. Вечер работы.

А теперь забудьте всё, что я написал выше.

Не потому что неправда. Потому что не туда пошли изначально.

За вопросом «какую модель взять» почти всегда стоит надежда, что правильный выбор всё решит. Но я пока не видел ни одного случая, когда это срабатывает. Упираются не в модель.

Упираются в то, что стандарт не сформулирован: он живёт в голове главреда и достаётся оттуда в режиме «мне не нравится». В то, что источники не описаны и каждый берёт цифры откуда придётся. В то, что никто не знает, где текст проверяется и кем, потому что проверяет его тот, у кого сегодня есть время.

Более сильная модель не чинит ни одну из этих вещей. Она делает ровно одно: быстрее производит то, что вы всё равно не умеете принять. Вы получаете больше текста, который некому оценить по критерию, которого нет.

Поэтому мой ответ на «с чего начать» звучит скучно. Возьмите то, что уже под рукой. Найдите одну задачу, которая повторяется каждую неделю и от которой воет вся команда. Опишите её словами: что на входе, что на выходе, что считается браком. Не «пиши хорошо», а что именно делает текст непригодным. Пропишите процесс и доведите до состояния, когда он идёт без вашего участия в каждом шаге.

Вот тогда вопрос про модель станет осмысленным. Вы упрётесь и будет видно во что: в модель, в окружение или в собственное описание задачи. До этой точки ответить на него нечем.

И последнее, неприятное. Гонка за релизами — это способ не делать скучную часть. Читать про новое приятно, ощущается как работа, не требует ни одного решения и никого не злит. А сесть и выписать редполитику, договориться, кто отвечает за факты, и признать вслух, что ваш стандарт нигде не зафиксирован, — это конфликт, время и неудобные разговоры.

Поэтому все обсуждают модели. Модели обсуждать безопасно.

#контентменеджерское
3👍1