Autor: Jakub Rusinowski · Ostatnia aktualizacja: 16 lipca 2026
ZAPOWIEDŹ (lipiec 2026). Pierwszy model o otwartych wagach od Thinking Machines Lab — i pierwszy otwarty model klasy ~1 biliona parametrów, który natywnie przyjmuje wejście tekstowe, obrazowe i dźwiękowe przy oknie kontekstu 1 mln tokenów. Inkling to rzadki multimodalny transformer Mixture-of-Experts: 975B parametrów łącznie, ale tylko ~41B aktywnych na token (256 ekspertów, 6 wybieranych przez routing plus 2 stale aktywne współdzielone). Wytrenowano go na 45 bilionach tokenów tekstu, obrazów, dźwięku i wideo; rozumuje natywnie w wielu modalnościach, z siedmioma poziomami wysiłku do wyboru (od żadnego po maksymalny). Dostępny w pełnym BF16 (~2 TB VRAM, Hopper i nowsze) oraz w dobrze skalibrowanym 4-bitowym buildzie NVFP4 (~600 GB, Blackwell), oba z warstwami MTP do dekodowania spekulatywnego dla szybszego wnioskowania. Wydany na licencji Apache 2.0 i pozycjonowany jako baza do personalizacji poprzez fine-tuning na firmowej platformie Tinker — „zbudowany do personalizacji, nie do dominacji w tabelach liderów”. Wymaga sprzętu klasy centrum danych; większość użytkowników sięgnie po niego przez hostowane API. Specyfikacja pochodzi z materiałów premierowych i karty modelu na Hugging Face — zweryfikuj ją, zanim na niej polegniesz.
| Licence | What it permits | Applies to |
|---|---|---|
Apache-2.0 | Commercial use permitted Commercial use permitted. No usage restrictions beyond attribution. | Inkling (NVFP4), Inkling (BF16) |
| Inkling (NVFP4) | Min 589 GB VRAM · NVFP4 (4-bit) · 1,000,000 ctx · |
| Inkling (BF16) | Min 589 GB VRAM · BF16 (full precision) · 1,000,000 ctx · |
Install Ollama then run: ollama run
Minimum VRAM: 589 GB. For best results use Q4_K_M quantization.
Inkling needs about 589 GB VRAM at NVFP4 (4-bit) quantization for its smallest variant. Variants: Inkling (NVFP4) (589 GB, NVFP4 (4-bit)); Inkling (BF16) (589 GB, BF16 (full precision)). On Apple Silicon, unified memory counts toward this requirement.
Inkling's smallest variant needs about 589 GB, which exceeds a single RTX 4090 (24 GB). Use multiple GPUs, a higher-VRAM card, or Apple Silicon with large unified memory.
Q4_K_M is the best balance of quality and VRAM for Inkling in most cases. Choose Q8_0 for near-lossless quality if you have spare VRAM, or smaller quants (Q3/Q2) only when memory is tight.
Install Ollama, then run: ollama run . This downloads Inkling and starts a local, OpenAI-compatible endpoint — no internet connection is needed after the initial download.