Inkling — Local AI Model by Thinking Machines

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 16 lipca 2026

ZAPOWIEDŹ (lipiec 2026). Pierwszy model o otwartych wagach od Thinking Machines Lab — i pierwszy otwarty model klasy ~1 biliona parametrów, który natywnie przyjmuje wejście tekstowe, obrazowe i dźwiękowe przy oknie kontekstu 1 mln tokenów. Inkling to rzadki multimodalny transformer Mixture-of-Experts: 975B parametrów łącznie, ale tylko ~41B aktywnych na token (256 ekspertów, 6 wybieranych przez routing plus 2 stale aktywne współdzielone). Wytrenowano go na 45 bilionach tokenów tekstu, obrazów, dźwięku i wideo; rozumuje natywnie w wielu modalnościach, z siedmioma poziomami wysiłku do wyboru (od żadnego po maksymalny). Dostępny w pełnym BF16 (~2 TB VRAM, Hopper i nowsze) oraz w dobrze skalibrowanym 4-bitowym buildzie NVFP4 (~600 GB, Blackwell), oba z warstwami MTP do dekodowania spekulatywnego dla szybszego wnioskowania. Wydany na licencji Apache 2.0 i pozycjonowany jako baza do personalizacji poprzez fine-tuning na firmowej platformie Tinker — „zbudowany do personalizacji, nie do dominacji w tabelach liderów”. Wymaga sprzętu klasy centrum danych; większość użytkowników sięgnie po niego przez hostowane API. Specyfikacja pochodzi z materiałów premierowych i karty modelu na Hugging Face — zweryfikuj ją, zanim na niej polegniesz.

Licence

LicenceWhat it permitsApplies to
Apache-2.0Commercial use permitted
Commercial use permitted. No usage restrictions beyond attribution.
Inkling (NVFP4), Inkling (BF16)

Hardware Requirements

Inkling (NVFP4)Min 589 GB VRAM · NVFP4 (4-bit) · 1,000,000 ctx ·
Inkling (BF16)Min 589 GB VRAM · BF16 (full precision) · 1,000,000 ctx ·

How to Run Locally

Install Ollama then run: ollama run

Minimum VRAM: 589 GB. For best results use Q4_K_M quantization.

Inkling — Frequently Asked Questions

How much VRAM does Inkling need?

Inkling needs about 589 GB VRAM at NVFP4 (4-bit) quantization for its smallest variant. Variants: Inkling (NVFP4) (589 GB, NVFP4 (4-bit)); Inkling (BF16) (589 GB, BF16 (full precision)). On Apple Silicon, unified memory counts toward this requirement.

Can I run Inkling on an RTX 4090 (24 GB)?

Inkling's smallest variant needs about 589 GB, which exceeds a single RTX 4090 (24 GB). Use multiple GPUs, a higher-VRAM card, or Apple Silicon with large unified memory.

What quantization should I use for Inkling?

Q4_K_M is the best balance of quality and VRAM for Inkling in most cases. Choose Q8_0 for near-lossless quality if you have spare VRAM, or smaller quants (Q3/Q2) only when memory is tight.

How do I run Inkling with Ollama?

Install Ollama, then run: ollama run . This downloads Inkling and starts a local, OpenAI-compatible endpoint — no internet connection is needed after the initial download.

Can I Run Inkling on My GPU?