Naciśnij Enter, aby wyszukać

LINUX

Kimi K3 w domu? Zobacz, co naprawdę odpalisz lokalnie

kimi k3
REKLAMA

Najmocniejszy otwarty model tego roku właśnie wyszedł. Moonshot pokazał Kimi K3 i w topowych laboratoriach AI zrobiło się nerwowo. To model z otwartymi wagami, 2,8 biliona parametrów, a w zadaniach agentowych i przy pisaniu kodu trzyma poziom blisko najlepszych zamkniętych rozwiązań. Brzmi jak spełnienie marzeń każdego, kto chciałby mieć własny model bez comiesięcznego abonamentu. Problem w tym, że słowa „otwarty” i „uruchomisz go u siebie” to dwie zupełnie różne historie.

Otwarte wagi to nie to samo co domowy sprzęt

Otwarte wagi oznaczają, że producent udostępnił gotowy model do pobrania i lokalnego uruchomienia. Teoretycznie możesz go ściągnąć i odpalić na własnej maszynie. Praktycznie w przypadku Kimi K3 ten warunek o „własnej maszynie” robi całą robotę, bo mówimy o sprzęcie z zupełnie innej półki.

Oficjalne minimum to osiem kart klasy B300 lub GB300 albo osiem AMD MI355X, co daje w sumie około 2,3 TB pamięci GPU. Pojedynczy serwer w tej konfiguracji zaczyna się od mniej więcej pół miliona dolarów, a po doliczeniu szafy rack, zasilania awaryjnego, chłodzenia i instalacji elektrycznej realny budżet dochodzi do kilkuset tysięcy. Do tego dochodzi prąd, bo taki zestaw pod pełnym obciążeniem potrafi zjeść kilkanaście tysięcy kilowatogodzin miesięcznie. To już nie jest składanie komputera, to raczej przypadkowa kariera w branży serwerowni.

Co z tego faktycznie odpalisz na własnym sprzęcie

Na szczęście lokalne AI nie kończy się na Kimi K3. Jeśli chcesz coś realnie uruchomić na sprzęcie, który da się kupić bez kredytu, celuj w modele od 12 do 30 miliardów parametrów. To właśnie tam dzieje się teraz najwięcej dobrego dla zwykłego użytkownika.

Gemma 4 12B to rozsądny wybór na laptopa z 16 GB pamięci VRAM lub zunifikowanej. Radzi sobie z tekstem, obrazem i dźwiękiem, a przy tym nie wymaga ekstremalnego sprzętu. Masz desktop z kartą pokroju RTX 4090 albo Maka z 32 GB? Wtedy sięgniesz po Devstral Small od Mistrala, przygotowany pod pracę z kodem i wieloma plikami naraz. Ciekawą opcją jest też Qwen3 Coder w wariancie 30B. Aktywuje tylko około 3,3 miliarda parametrów na token, choć wszystkie wagi i tak muszą zmieścić się w pamięci.

Jak postawić lokalny model na CachyOS

Skoro na co dzień pracuję na systemie opartym na Arch, uruchomienie modelu lokalnie zajmuje dosłownie kilka minut. Najprostsza droga prowadzi przez Ollamę, która jest dostępna wprost z repozytoriów. Poniżej pełna ścieżka od zera do działającego modelu.

1. Zainstaluj Ollamę odpowiednią dla swojej karty. Dla karty Nvidia użyj wariantu z obsługą CUDA, dla AMD wariantu z ROCm, a dla samego procesora podstawowej wersji.

sudo pacman -S ollama-cuda

2. Włącz i uruchom usługę, żeby startowała razem z systemem.

sudo systemctl enable --now ollama

3. Pobierz model dopasowany do ilości pamięci karty. Nazwy i dostępne rozmiary sprawdzisz w bibliotece na ollama.com/library, poniżej przykład z lekkim modelem.

ollama pull gemma3:12b

4. Uruchom model i sprawdź, czy odpowiada.

ollama run gemma3:12b

5. Jeśli wolisz wygodny interfejs w przeglądarce zamiast konsoli, dołóż Open WebUI, które łączy się z Ollamą lokalnie.

docker run -d --network=host -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main

ollama

Cała sztuka polega na dobraniu rozmiaru modelu do pamięci karty. Model powinien zmieścić się w VRAM z zapasem na kontekst, więc przy 16 GB rozsądny sufit to warianty do kilkunastu miliardów parametrów, a mocniejsze modele zostaw dla kart z większą pamięcią lub sięgnij po mocniejszą kwantyzację.

Może Cię zainteresować: Ollama i Gemma 2: Jak uruchomić AI na 8GB RAM?

Jak postawić lokalny model na Windowsie

Na Windowsie próg wejścia jest jeszcze niższy, bo Ollama ma natywne wsparcie i gotowy instalator, więc nie potrzebujesz WSL2 ani Dockera, żeby zacząć. Cała droga do działającego modelu wygląda następująco.

  1. Pobierz instalator ze strony ollama.com i uruchom plik OllamaSetup.exe. Waży około 5 MB, nie wymaga uprawnień administratora i sam stawia usługę w tle. Jeśli SmartScreen pokaże ostrzeżenie, kliknij Więcej informacji, a następnie Uruchom mimo to.
  2. Przy pierwszym starcie zapora Windows może zapytać o dostęp. Wybierz Zezwól dla sieci prywatnych, dzięki czemu lokalne aplikacje połączą się z Ollamą pod adresem localhost:11434, a nic nie zostanie wystawione do internetu.
  3. Otwórz nowe okno PowerShell, bo stary terminal nie widzi zaktualizowanej zmiennej PATH. Możesz od razu sprawdzić, czy wszystko wstało.
    ollama --version
  4. Pobierz i uruchom model dopasowany do pamięci karty. Nazwy i rozmiary znajdziesz w bibliotece na ollama.com/library.
    ollama run gemma3:12b
  5. Jeśli wolisz klikać zamiast pisać w konsoli, skorzystaj z wbudowanej aplikacji. Ikona Ollamy siedzi w zasobniku systemowym obok zegara, klikasz ją, wybierasz model z listy i piszesz jak w zwykłym czacie, tylko lokalnie.

W kwestii sprzętu obowiązuje ta sama zasada co na Linuksie, czyli liczy się pamięć karty. Dla Nvidii Ollama korzysta z CUDA i nie musisz instalować toolkitu osobno. Dla kart AMD wsparcie na Windowsie działa przez ROCm, ale bywa kapryśne, więc jeśli siedzisz na Radeonie i zależy Ci na wydajności, pewniejszym wyborem pozostaje Linux. Interfejs w przeglądarce dołożysz tak samo jak wcześniej, stawiając Open WebUI przez Docker Desktop, choć dla większości osób natywna aplikacja w zupełności wystarczy.

Kimi K3 bez własnej serwerowni

Jeśli mimo wszystko chcesz skorzystać właśnie z Kimi K3, jest sposób, który omija cały problem sprzętu. Model działa przez API zgodne ze standardem OpenAI, więc podpinasz go do dowolnego klienta obsługującego taki endpoint i płacisz tylko za realne użycie. Co ważne, w porównaniu z topowymi zamkniętymi modelami wypada tu wyraźnie taniej za tokeny, więc do zadań agentowych bywa najbardziej opłacalną opcją. Sprzęt zostaje po stronie dostawcy, a Ty korzystasz z pełnej mocy modelu bez inwestowania w szafę serwerową.

Otwarte wagi kontra open source

Warto trzymać się faktów, bo nagłówki lubią to mieszać. Kimi K3 jest modelem z otwartymi wagami, ale nazywanie go w pełni otwartoźródłowym jest już naciągane. Możesz pobrać i uruchomić model, ponieważ wagi są publicznie dostępne. Moonshot nie udostępnił wszystkiego, co potrzebne do odtworzenia go od podstaw. Pełny open source oznacza znacznie więcej niż same wagi, więc gdy widzisz taki model reklamowany jako otwartoźródłowy, po prostu sprawdź, co dokładnie zostało wydane.

Czy warto się tym w ogóle interesować

Kimi K3 pokazuje, jak szybko otwarte modele gonią czołówkę, i to jest realnie dobra wiadomość. Dla zwykłego użytkownika ciekawszy jest jednak nie sam gigant, którego w domu nie odpali. Liczy się cały segment modeli od 12 do 30 miliardów parametrów. One spokojnie chodzą na sprzęcie, jaki wielu z nas już ma na biurku. Jeśli myślałeś o lokalnym AI, to dobry moment, żeby postawić pierwszy model u siebie. Sam sprawdzisz, ile da się zrobić bez chmury.

📸 Miniaturka i zdjęcie główne tego artykułu zostały wykonane przez autora.

UDOSTĘPNIJ
Reklama
REKLAMA
ciasteczka
Przegląd prywatności

Ta strona korzysta z ciasteczek, aby zapewnić Ci najlepszą możliwą obsługę. Informacje o ciasteczkach są przechowywane w przeglądarce i wykonują funkcje takie jak rozpoznawanie Cię po powrocie na naszą stronę internetową i pomaganie naszemu zespołowi w zrozumieniu, które sekcje witryny są dla Ciebie najbardziej interesujące i przydatne.