Laptop odpowiada na pytanie, choć jest całkowicie odłączony od internetu. Bez żadnych zmian odpowiada też na to samo pytanie przesłane przez drugą aplikację na tym samym komputerze. Ten drugi krok zmienia laptop, którego już używasz, w niewielki, osobisty serwer AI dla innych aplikacji i skryptów.
Chodzi o uruchomienie pobranego modelu, nie o jego trenowanie. Jeśli nie wiesz jeszcze, czy twój laptop ma wystarczająco dużo RAM-u lub VRAM-u, zacznij od artykułu ile RAM-u potrzebuje laptop do lokalnego AI. Jeśli wiesz, że sprzęt spełnia wymagania, czytaj dalej.
Lokalna konfiguracja AI składa się z czterech warstw. Jeśli wiesz, za co odpowiada każda z nich, łatwiej będzie ci wykonać kolejne kroki.
Wagi modelu to pobierany plik, na przykład skwantyzowany wariant niewielkiego modelu o wielkości 3,4 GB. Tyle zajmuje na dysku; ta liczba nie mówi, ile RAM-u będzie potrzebne podczas pracy.
Silnik inferencji wczytuje wagi i odpowiada na zapytania. W tym poradniku jest nim Ollama, która udostępnia własne lokalne API HTTP. To dzięki silnikowi z modelu na laptopie mogą korzystać także inne aplikacje.
Warstwa kliencka wysyła zapytania do silnika. Może nią być czat wbudowany w Ollamę, krótki skrypt albo osobna aplikacja. Od wybranej warstwy klienckiej zależy, czy treść zapytania zostanie na laptopie, czy zostanie wysłana poza niego.
Opcjonalny indeks dokumentów pozwala modelowi czatu przeszukiwać twoje pliki. Potrzebny jest do tego osobny model tworzący reprezentacje tekstu, czyli embeddingi, oraz osobne miejsce na dane. Taki indeks nie powstaje automatycznie; nie będziemy go tu konfigurować.
Schemat jest prosty: aplikacja lub skrypt wysyła żądanie na adres 127.0.0.1:11434, pod którym działa Ollama. Ta wczytuje pobrany model. Usunięcie modelu nie usuwa historii czatu zapisanej przez aplikację kliencką, bo te dane są przechowywane osobno.
Zanim cokolwiek zainstalujesz, poświęć dwie minuty na spisanie parametrów laptopa: ilości pamięci RAM, systemu operacyjnego i procesora, pojemności dedykowanej pamięci graficznej (VRAM), jeśli laptop ją ma, oraz wolnego miejsca na dysku SSD. Dlaczego RAM i VRAM są ważne, wyjaśniamy w artykule ile RAM-u potrzebuje laptop do lokalnego AI.
Poniżej znajdziesz dwa laptopy dostępne obecnie na refurbed. Oba zostały profesjonalnie przetestowane, wyczyszczone i odnowione oraz są objęte 12-miesięczną gwarancją. Pierwszy to podstawowy model Apple z układem Apple Silicon, drugi to laptop z Windowsem i dedykowaną pamięcią graficzną. Na każdym z nich wykonasz wszystkie opisane dalej kroki.
Na macOS i w systemie Windows zainstaluj oficjalną aplikację Ollama, a w Linuksie skorzystaj z instrukcji instalacji. Następnie uruchom Ollamę. Jeśli w Linuksie serwer jeszcze nie nasłuchuje, wpisz ollama serve.
Aplikacja oferuje zarówno pracę lokalną, jak i opcje chmurowe. Wybierz pobrany model oznaczony lokalnym tagiem. Lokalne uruchamianie modelu nie wymaga logowania.
Aby przejść przez poradnik, pobierz dokładnie ten wariant: qwen3.5:4b-q4_K_M. Plik do pobrania ma 3,4 GB. Pełny tag jest ważny: ogólne oznaczenie „latest” może niepostrzeżenie wskazywać model znacznie większy od testowanego. Wielkość pobieranego pliku mówi, ile miejsca zajmie on na dysku, ale nie ile RAM-u model będzie potrzebował podczas odpowiadania na zapytania.
Do pierwszej rozmowy z modelem wystarczą dwa polecenia:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Pierwsze pobiera model, drugie otwiera interaktywny czat. Zamiast zwykłego powitania podsuń modelowi niewielkie, konkretne zadanie, na przykład: „Zamień te trzy notatki ze spotkania w listę zadań. Nie wymyślaj dat”.
Na koniec wpisz /bye, aby zakończyć czat.
Gdy piszesz w terminalu, zapytania wysyła do silnika wbudowany czat. Teraz skieruj żądanie bezpośrednio do tego samego silnika, tak jak zrobiłaby to inna aplikacja.
Na macOS lub Linuksie:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'
W systemie Windows, w PowerShellu:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'
W odpowiedzi odszukaj message.content. Ustawienie stream na false pozwala otrzymać jedną pełną odpowiedź zamiast kolejnych fragmentów. Dzięki num_ctx: 4096 kontekst w tym pierwszym teście pozostaje niewielki w porównaniu ze znacznie wyższą maksymalną wartością deklarowaną dla modelu.
Ollama zwraca nie tylko treść odpowiedzi. Oprócz message.content warto sprawdzić pola opisujące przebieg żądania: load_duration, prompt_eval_count, prompt_eval_duration, eval_count i eval_duration.
Dzięki nim możesz osobno sprawdzić czas wczytywania modelu do pamięci i czas generowania odpowiedzi. Sama liczba „tokenów na sekundę” zaciera tę różnicę. Pierwsze żądanie po uruchomieniu Ollamy zwykle trwa najdłużej, bo trzeba wczytać model. Przy następnym nie trzeba tego robić, o ile model pozostaje w pamięci.
Nie podajemy tu wyników jako typowych, bo zależą one w całości od twojego sprzętu. Porównaj wartości tych pól dla dwóch prób na tym samym laptopie, zamiast sugerować się jedną deklarowaną szybkością.
Do podstawowej obsługi modeli wystarczą trzy polecenia.
ollama ps pokazuje, które modele są obecnie wczytane i na czym działają. W kolumnie procesora zobaczysz 100% GPU, 100% CPU albo podział pracy między nimi.
ollama ls wyświetla wszystkie pobrane modele.
ollama rm qwen3.5:4b-q4_K_M usuwa pobrany model, którego już nie potrzebujesz.
Ollama domyślnie zwalnia model z pamięci po pięciu minutach bezczynności. Jeśli ollama ps nie wyświetla żadnego wczytanego modelu, wyślij kolejne żądanie, zanim uznasz to za awarię.
Teraz możesz skierować zapytania drugiej aplikacji do laptopa zamiast do usługi w chmurze. Dzięki temu model na twoim komputerze będzie obsługiwać nie tylko wbudowany czat.
Większość aplikacji, w których można ustawić własny adres API zgodnego z OpenAI, prosi o trzy dane: bazowy adres URL, nazwę modelu i klucz API. Podaj http://localhost:11434/v1/ jako adres bazowy i qwen3.5:4b-q4_K_M jako nazwę modelu.
Pole na klucz API może budzić wątpliwości. Niektóre aplikacje nie pozwalają pozostawić go pustego. Dlatego dokumentacja Ollamy podaje wartość zastępczą api_key='ollama' i wyjaśnia: lokalny serwer wymaga niepustego pola, lecz ignoruje wpisaną wartość. Ten ciąg niczego nie uwierzytelnia: służy jedynie do wypełnienia formularza, nie jest hasłem.
Zgodność dotyczy tylko części funkcji danego API. Jeśli potrzebujesz na przykład przesyłania obrazów lub wywoływania narzędzi, sprawdź tę konkretną funkcję w używanej aplikacji, zamiast zakładać, że wszystko zadziała automatycznie.
Wciąż nie masz pewności, czy coś nie łączy się z internetem w tle. Oto prosty test.
Gdy model pobierze się w całości, wyłącz Wi-Fi w laptopie albo odłącz kabel sieciowy. Następnie ponów wcześniejsze zapytanie w czacie lub przez API. Jeśli model odpowie bez żadnego połączenia z siecią, masz dowód, że działa lokalnie.
Odpowiedź, która pojawia się wyłącznie przy połączeniu z internetem, nie jest takim dowodem. Nie są nim też odpowiedzi z https://ollama.com zamiast localhost ani z modelu chmurowego zamiast pobranego. Ollama obsługuje żądania do lokalnego modelu na twoim komputerze, a osobne modele chmurowe działają na zewnętrznych serwerach.
Samo uruchomienie modelu lokalnie nie wystarczy, by zadbać o prywatność. Warto wiedzieć, jakie zabezpieczenia już działają, a na czym nie można polegać.
Ollama domyślnie nasłuchuje wyłącznie pod adresem 127.0.0.1:11434, dostępnym z twojego laptopa, ale nie z innych urządzeń. Nie zmieniaj tego. Nie ustawiaj OLLAMA_HOST=0.0.0.0 ani nie przekierowuj portu 11434 do publicznego internetu. Wspomniany wcześniej klucz zastępczy niczego nie uwierzytelnia, więc wystawiony w ten sposób port nie będzie chroniony hasłem.
Jeśli chcesz całkowicie wyłączyć funkcje chmurowe Ollamy, możesz to zrobić. Nie jest to konieczne do pracy lokalnej: wystarczy wybrać pobrany model oznaczony lokalnym tagiem. Dodaj {"disable_ollama_cloud": true} do pliku ~/.ollama/server.json albo ustaw OLLAMA_NO_CLOUD=1. W obu przypadkach uruchom ponownie Ollamę, aby zmiana zaczęła działać.
Dostęp do tej konfiguracji z innego pokoju lub urządzenia to osobny, bardziej zaawansowany temat. Wymaga prywatnej sieci i serwera proxy z uwierzytelnianiem, ustawionego przed Ollamą. Nie omawiamy tego tutaj; bezpośrednie wystawienie portu nie jest właściwą metodą.
Oto najczęstsze problemy i miejsca, od których warto zacząć szukanie ich przyczyny.
Połączenie odrzucone. Sprawdź, czy działa aplikacja Ollama albo serwer uruchomiony poleceniem ollama serve, i spróbuj ponownie.
Pierwsza odpowiedź przychodzi wolno, następne szybciej. To czas wczytywania modelu, nie tempo generowania odpowiedzi. Porównaj opisane wyżej pola, żeby zobaczyć różnicę.
Wszystko działa znacznie wolniej, niż się spodziewasz. Uruchom ollama ps, by sprawdzić, czy model działa tylko na CPU, czy obciążenie jest podzielone między CPU a GPU. Sprawdź, czy twoja karta graficzna i jej sterowniki są obsługiwane w używanym systemie.
Zaczyna brakować pamięci lub program się zamyka. Wybierz mniejszy wariant modelu, zmniejsz num_ctx i przed kolejną próbą zamknij aplikacje zużywające dużo pamięci.
Kończy się miejsce na dysku. Wpisz ollama ls, by sprawdzić pobrane modele, a nieużywane usuń za pomocą ollama rm.
Jeśli ta metoda ci nie odpowiada, bo na przykład wolisz przeglądać modele w interfejsie graficznym lub mieć dokładniejszą kontrolę nad CPU i GPU, przyjrzyj się LM Studio albo llama.cpp. To powód, by zmienić silnik, a nie uruchamiać dwóch konfiguracji równolegle.
Czy po konfiguracji potrzebuję internetu? Nie. Po pobraniu modelu zarówno rozmowa z nim, jak i wywołania jego API działają bez połączenia z internetem.
Czy zastępczy klucz API zabezpiecza dostęp do serwera? Nie. Lokalny serwer Ollamy przyjmuje każdą niepustą wartość, ale jej nie sprawdza. Klucz wymagany przez niektóre aplikacje nie stanowi więc zabezpieczenia.
Czy moje zapytanie pozostaje na laptopie? Tak, jeśli korzystasz z pobranego modelu lokalnego. Ollama udostępnia także osobne modele chmurowe, obsługiwane na zewnętrznych serwerach. To kwestia wybranego tagu, a nie ukrytego ustawienia domyślnego.
Czy potrzebuję dedykowanej karty graficznej? Nie. Laptop korzystający tylko z CPU też może uruchomić niewielki model, choć zwykle wolniej. ollama ps pokazuje, jak obsłużono konkretne żądanie.
A jeśli chcę użyć większego albo innego modelu? Podmień tag w poleceniach ollama pull i ollama run, ale wcześniej sprawdź ilość RAM-u i VRAM-u. Więcej informacji znajdziesz w artykule ile RAM-u potrzebuje laptop do lokalnego AI.
Czy model będzie odtąd pamiętać moje dokumenty? Nie. Model czatu sam z siebie nie zapamięta trwale zawartości folderu. Przeszukiwanie twoich plików wymaga osobnego indeksu dokumentów. To opcjonalna konfiguracja, której tu nie opisujemy.
Wybierz konkretne zadanie, które masz do zrobienia, i wykonaj je dwoma sposobami: we wbudowanym czacie oraz w podłączonej przed chwilą aplikacji. Możesz na przykład streścić osobistą notatkę, podzielić zestaw plików na grupy z etykietami albo poprosić o wyjaśnienie krótkiego fragmentu kodu prostym językiem.
Niezależnie od wyboru zanotuj dokładny tag modelu, wersję silnika, ustawienie kontekstu, adres URL i treść zadania. Dzięki temu ty lub ktoś inny będziecie mogli później odtworzyć warunki próby.
Jeśli okaże się, że twojemu laptopowi brakuje RAM-u lub VRAM-u, warto rozważyć wymianę na sprzęt z większym zapasem pamięci. W następnym artykule z tej serii zajmiemy się tworzeniem niewielkiego zestawu modeli: jednego do rozmów, drugiego do kodu i trzeciego do wyszukiwania.
Zapisz się po raz pierwszy do naszego newslettera i odbierz 65 zł rabatu!
Nie przegap żadnej oferty.
Informacje na temat używania danych osobowych znajdują się w naszej Polityce prywatności
Confirm sign-up
Prawie gotowe: Wysłaliśmy Ci e-mail z potwierdzeniem