knowledge / wiki

Wiki

Инженерная база LLM Crew: то, что хочется сохранить, воспроизвести и использовать в следующем проекте.

ГайдыБенчмаркиМоделиGPU / ИнференсАгенты / IDEMLOpsOpen SourceПолезности
Бенчмарк

Влияние транспорта KV-переноса на производительность PD-disaggregation на примере инференса MiniMax-M3

268 прогонов сравнивают RDMA/InfiniBand с GPUDirect и TCP/Ethernet: TTFT, throughput, надёжность PD-disaggregation и 13 интерактивных графиков.

#PD-disaggregation#KV cache#RDMA#InfiniBand#MiniMax-M3#Бенчмарк
Читать ↗
Гайд

Механизмы внимания в современных LLM

Как устроен attention в современных LLM: MHA, GQA, MLA, разрежённые и линейные схемы, цена KV cache и что реально ускоряет инференс.

#Attention#KV cache#MLA#Разрежённое внимание#Инференс
Читать ↗
Агенты / IDE

DeepSeek Harness: почему это гораздо больше, чем ещё один AI-агент

DeepSeek выпустил не новый чат, не IDE и даже не просто coding agent. DeepSeek Harness - это открытая платформа, которая превращает модель в полноценного агента и позволяет пересобирать почти любую часть его runtime как плагин.

#DeepSeek#Harness#DeepSeek Harness#Agents
Читать ↗
Гайдрекомендуем

Что такое нейросеть: от токенов и весов до GPU и CUDA

Цельная картина от токенов и слоёв трансформера до GPU, CUDA и библиотек, которые запускают вычисления.

#Neural Networks#GPU#CUDA
Читать ↗
Гайдрекомендуем

Как выбрать и запустить LLM на своём железе: квантование, GGUF, LoRA и QLoRA

Выбор модели под VRAM, методы квантования, формат GGUF, fine-tuning и метрики деградации.

#Local LLM#GGUF#LoRA
Читать ↗
полезности

Полезности LLM Crew

Анонсы, новые материалы и инженерные находки сообщества - в Telegram-канале LLM Crew.

#Telegram#Crew
Открыть Telegram ↗