Анализ данных (Data analysis)
50.6K subscribers
3.55K photos
446 videos
1 file
2.9K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
Исследователи NVIDIA перенесли модель владения Rust в GPU-kernels.

Paper: “Fearless Concurrency on the GPU”. В нём представлен cuTile Rust.

Проблема была в том, что при написании кастомных GPU-ядер на Rust разработчикам фактически приходилось выходить за пределы гарантий безопасности Rust.

cuTile Rust пытается это исправить:

* mutable outputs разбиваются на непересекающиеся части
* запуск kernels сохраняет правила ownership от host до device
* при необходимости остаются локальные opt-out механизмы для низкоуровневого контроля

Производительность тоже держится на уровне:

* 7 TB/s для element-wise операций на NVIDIA B200
* 2 PFlop/s для GEMM, это 96% от cuBLAS
* результат сопоставим с cuTile Python в пределах погрешности измерений

Авторы также собрали Grout, inference engine поверх cuTile Rust, и прогнали реальные модели:

* 171 tokens/s для Qwen3-4B на RTX 5090
* 82 tokens/s для Qwen3-32B на B200
* конкурентный уровень рядом с vLLM и SGLang

Итог - безопасный и идиоматичный Rust почти на полной CUDA-производительности.

Для Rust в ML-инфраструктуре это большой шаг.

http://arxiv.org/abs/2606.15991

#Rust #RustLang #GPU #CUDA #MachineLearning #SystemsProgramming #NVIDIA

@data_analysis_ml
12👍7🔥5
UnMaskFork: несколько диффузионных моделей вместе решают одну задачу

Статья от Sakana UnMaskFork, принятая на ICML 2026, предлагает новый способ масштабирования вычислений во время вывода для маскированных диффузионных языковых моделей.

Обычные LLM генерируют текст последовательно - токен за токеном. Маскированные диффузионные модели начинают с полностью скрытого текста и постепенно восстанавливают его части, причём могут заполнять несколько фрагментов параллельно.

Но привычный подход к test-time scaling - повысить температуру и сгенерировать много разных ответов, для таких моделей работает не слишком эффективно.

UnMaskFork решает проблему иначе:

- несколько диффузионных моделей работают над одним ответом;
- каждая по очереди раскрывает те участки, в которых наиболее уверена;
- промежуточный результат передаётся следующей модели;
- поиск по дереву Монте-Карло выбирает наиболее перспективную последовательность действий.

Разнообразие создаётся не случайностью, а переключением между моделями с разными сильными сторонами.

В экспериментах подход улучшил результаты Dream-Coder на задачах по программированию и показал стабильный рост качества на математических бенчмарках при увеличении вычислений во время вывода.

При этом UnMaskFork:

- не требует дополнительного обучения;
- не меняет внутреннюю архитектуру моделей;
- работает как отдельный алгоритм координации;
- позволяет комбинировать модели, обученные на разных данных и разными методами.

Работа продолжает исследования Sakana AI в области «коллективного разума» моделей - систем, где результат достигается не одной большой LLM, а координацией нескольких разных моделей.

Блог: https://pub.sakana.ai/umf
Статья: https://arxiv.org/abs/2602.04344

#AI #LLM #DiffusionModels #ICML2026 #MachineLearning #SakanaAI
8🔥5👍4