Wiki
Инженерная база LLM Crew: то, что хочется сохранить, воспроизвести и использовать в следующем проекте.
Влияние транспорта KV-переноса на производительность PD-disaggregation на примере инференса MiniMax-M3
268 прогонов сравнивают RDMA/InfiniBand с GPUDirect и TCP/Ethernet: TTFT, throughput, надёжность PD-disaggregation и 13 интерактивных графиков.
Читать ↗Механизмы внимания в современных LLM
Как устроен attention в современных LLM: MHA, GQA, MLA, разрежённые и линейные схемы, цена KV cache и что реально ускоряет инференс.
Читать ↗DeepSeek Harness: почему это гораздо больше, чем ещё один AI-агент
DeepSeek выпустил не новый чат, не IDE и даже не просто coding agent. DeepSeek Harness - это открытая платформа, которая превращает модель в полноценного агента и позволяет пересобирать почти любую часть его runtime как плагин.
Читать ↗Что такое нейросеть: от токенов и весов до GPU и CUDA
Цельная картина от токенов и слоёв трансформера до GPU, CUDA и библиотек, которые запускают вычисления.
Читать ↗Как выбрать и запустить LLM на своём железе: квантование, GGUF, LoRA и QLoRA
Выбор модели под VRAM, методы квантования, формат GGUF, fine-tuning и метрики деградации.
Читать ↗Полезности LLM Crew
Анонсы, новые материалы и инженерные находки сообщества - в Telegram-канале LLM Crew.
Открыть Telegram ↗