← Zpět na novinky

Nvidia vydala Nemotron 3.5 Lightning: malý model s překvapivou rychlostí

2026-08-12 · 4 min čtení

Nvidia zveřejnila open-source model Nemotron 3.5 Lightning s 3,6 miliardami aktivních parametrů. Navzdory malé velikosti dosahuje srovnatelných výsledků s mnohem většími modely a zvládá téměř 670 tokenů za sekundu.

# Nvidia vydala Nemotron 3.5 Lightning: malý model s překvapivou rychlostí

Nvidia v srpnu 2026 vydala open-weight model Nemotron 3.5 Lightning, který pracuje s pouhými 3,6 miliardami aktivních parametrů a přitom na Intelligence Indexu dosahuje výsledků srovnatelných s OpenAI modelem gpt-oss-120b — modelem, který je zhruba čtyřikrát větší. Zásadní výhoda? Rychlost přes 670 tokenů za sekundu, což z něj dělá nejrychlejší model ve srovnávacím testu.

Co je nového

Nemotron 3.5 Lightning je takzvaný „open-weight" model — to znamená, že Nvidia veřejně zveřejňuje váhy modelu (tedy jeho naučené hodnoty) a kdokoliv si ho může stáhnout, spustit na vlastním hardwaru nebo upravit. To ho odlišuje od uzavřených modelů jako GPT-4o, které jsou dostupné pouze přes API.

Klíčová čísla:

Nvidia tak sází na filosofii „dost dobrý a extrémně rychlý" místo „co nejchytřejší za každou cenu". Jde o vědomý kompromis: model možná nedosáhne na absolutní špičku v nejnáročnějších testech logického uvažování, ale pro většinu praktických úkolů bude jeho rychlost cennější než marginální rozdíl v přesnosti.

Jak to vyzkoušet

Model je dostupný přes platformu Hugging Face pod názvem `nvidia/Nemotron-3.5-Lightning`. Stačí mít účet na Hugging Face a dostatečně výkonný hardware — ideálně GPU s minimálně 8 GB VRAM pro spuštění v plné přesnosti.

Praktický postup: 1. Přejdi na [huggingface.co](https://huggingface.co) a vyhledej `nvidia/Nemotron-3.5-Lightning` 2. Model stáhni pomocí knihovny `transformers` v Pythonu nebo přes nástroj `ollama` (pokud ho máš nainstalovaný) 3. Pro rychlé otestování bez vlastního hardwaru zkus platformu Hugging Face Spaces — Nvidia nebo komunita tam obvykle zveřejní interaktivní demo

Ukázkový prompt pro testování rychlosti a kvality odpovědí:

Shrň mi v pěti bodech hlavní rozdíly mezi SQL a NoSQL databázemi. Každý bod doplň konkrétním příkladem databázového systému.

Tento typ promptu prověří jak faktickou přesnost, tak schopnost strukturovat výstup — a při 670 tokenech za sekundu uvidíš výsledek prakticky okamžitě.

Kdy se to nehodí

Nemotron 3.5 Lightning není vhodný pro úlohy, kde je kritická maximální přesnost. Jde-li ti například o:

Pokud neprovozuješ vlastní server nebo nemáš GPU, musíš čekat na dostupnost přes cloudová API — oficiální cena za tokeny přes Nvidia API zatím nebyla zveřejněna pro evropský trh.

Co to znamená pro tebe

Pro vývojáře a firmy, které potřebují zpracovávat velké množství dotazů rychle a levně, je Nemotron 3.5 Lightning zajímavá alternativa. Menší model znamená nižší náklady na provoz — při stejném hardwaru obsloužíš několikanásobně více uživatelů než s modelem o desítkách miliard parametrů.

Pro běžného uživatele je hlavní zpráva jiná: open-weight modely jsou čím dál použitelnější i na spotřebitelském hardwaru. Model s 3,6 miliardami parametrů zvládne moderní herní GPU — a výkon srovnatelný s mnohem většími systémy je důkaz, že v AI nezáleží jen na surové velikosti, ale stále více na efektivitě tréninku.

Pro pokročilé

Nemotron 3.5 Lightning využívá architekturu MoE (Mixture of Experts) — proto číslo „3,6 miliardy aktivních parametrů" neznamená, že model celkově obsahuje pouze tolik parametrů. Aktivních je jich méně, celkový počet nebyl k datu vydání Nvidií oficiálně potvrzen. Inference lze optimalizovat pomocí kvantizace (např. formát GGUF přes llama.cpp), čímž lze snížit požadavky na VRAM na přibližně 4–6 GB. Model je vydán pod licencí, která umožňuje komerční použití — konkrétní podmínky jsou uvedeny na stránce modelu na Hugging Face.

Zdroj informací: The Decoder (https://the-decoder.com/nvidias-open-weight-nemotron-3-5-lightning-prioritizes-speed-over-maximum-intelligence/)