Bonsai 27B — Local AI Model by PrismML

Autor: Jakub Rusinowski · Ostatnia aktualizacja: 15 lipca 2026

ZAPOWIEDŹ (lipiec 2026). Pierwszy model klasy 27B, który działa na telefonie. Bonsai 27B to ekstremalnie niskobitowa przebudowa Qwen3.6-27B wykonana przez PrismML: architektura pozostaje bez zmian, ale wagi ściśnięto do mniej więcej 1–1,7 bita każda. Build 1-bitowy waży zaledwie 3,9 GB — dość mało, by zmieścić się w iPhonie — natomiast build trójwartościowy ma 5,9 GB i celuje w laptopy. Oba są multimodalne (tekst + obrazy), mają kontekst 262K tokenów i licencję Apache 2.0. PrismML podaje, że build trójwartościowy zachowuje ponad 95% wyników wersji pełnej precyzji (FP16) w zestawie 15 benchmarków, a build 1-bitowy ponad 90%, osiągając około 11 tok/s na iPhonie 17 Pro. Specyfikacja pochodzi z materiałów premierowych — zweryfikuj ją na kartach modeli na Hugging Face.

Licence

LicenceWhat it permitsApplies to
Apache-2.0Commercial use permitted
Commercial use permitted. No usage restrictions beyond attribution.
1-bit Bonsai 27B, Ternary Bonsai 27B

Hardware Requirements

1-bit Bonsai 27BMin 17 GB VRAM · 1-bit (binary, ~1.125 bpw) · 262,144 ctx ·
Ternary Bonsai 27BMin 17 GB VRAM · Ternary (1.58-bit, ~1.71 bpw) · 262,144 ctx ·

Recommended GPU

The cheapest GPU that runs Bonsai 27B locally (min 17 GB VRAM) is the AMD Radeon RX 7900 XT (20 GB).

Ujawnienie afiliacyjne: Niektóre odnośniki na tej stronie to linki afiliacyjne — jeśli dokonasz zakupu za ich pośrednictwem, LLM Configurator może otrzymać prowizję bez dodatkowych kosztów dla Ciebie. Jako uczestnik programu Amazon Associates, LLM Configurator zarabia na kwalifikujących się zakupach.
AMD Radeon RX 7900 XT 20GB
20 GB VRAM · 315 W board power
Ceny w 2026 są niestabilne — sprawdź aktualną ofertę.
Sprawdź cenę na Amazon

How to Run Locally

Install Ollama then run: ollama run

Minimum VRAM: 17 GB. For best results use Q4_K_M quantization.

Bonsai 27B — Frequently Asked Questions

How much VRAM does Bonsai 27B need?

Bonsai 27B needs about 17 GB VRAM at 1-bit (binary, ~1.125 bpw) quantization for its smallest variant. Variants: 1-bit Bonsai 27B (17 GB, 1-bit (binary, ~1.125 bpw)); Ternary Bonsai 27B (17 GB, Ternary (1.58-bit, ~1.71 bpw)). On Apple Silicon, unified memory counts toward this requirement.

Can I run Bonsai 27B on an RTX 4090 (24 GB)?

Yes — Bonsai 27B runs on an RTX 4090 (24 GB) and other 24 GB cards such as the RTX 3090. Smaller variants also fit comfortably on 8–16 GB GPUs at 1-bit (binary, ~1.125 bpw).

What quantization should I use for Bonsai 27B?

Q4_K_M is the best balance of quality and VRAM for Bonsai 27B in most cases. Choose Q8_0 for near-lossless quality if you have spare VRAM, or smaller quants (Q3/Q2) only when memory is tight.

How do I run Bonsai 27B with Ollama?

Install Ollama, then run: ollama run . This downloads Bonsai 27B and starts a local, OpenAI-compatible endpoint — no internet connection is needed after the initial download.

Can I Run Bonsai 27B on My GPU?