# Narzędzia i możliwości ## Przegląd Narzędzia to działania, które Twoi agenci mogą wykonywać podczas rozmów. Gdy agent musi przeglądać internet, uruchomić polecenie, odczytać plik lub sterować urządzeniem, używa narzędzi. Neotask dostarcza bogaty zestaw wbudowanych narzędzi obejmujących zarządzanie plikami, wykonywanie kodu, automatyzację przeglądarki, sterowanie urządzeniami, obsługę wiadomości, wyszukiwanie w internecie i wiele więcej. ## Operacje na plikach Agenci mogą odczytywać, zapisywać i edytować pliki w swojej przestrzeni roboczej: - **Odczyt**, Odczytaj zawartość pliku - **Zapis**, Utwórz lub nadpisz pliki - **Edycja**, Wprowadzaj ukierunkowane zmiany w określonych częściach pliku - **Zastosuj łatkę**, Stosuj wielosekcyjne ujednolicone łatki dla złożonych modyfikacji plików ## Wykonywanie kodu Agenci mogą uruchamiać polecenia powłoki z konfigurowalną izolacją: - **Wykonanie przez Gateway**, Uruchamiaj polecenia bezpośrednio na maszynie hostującej Gateway - **Wykonanie w piaskownicy**, Uruchamiaj polecenia w izolowanych kontenerach Docker z limitami zasobów - **Wykonanie na węźle**, Uruchamiaj polecenia na podłączonych urządzeniach towarzyszących (węzły macOS, Linux) ### Funkcje wykonywania - Konfigurowalne limity czasu (domyślnie 30 minut) - Zarządzanie zadaniami w tle (lista, odpytywanie, zatrzymywanie, czyszczenie) - Automatyczne przenoszenie do tła dla długo działających poleceń - Obsługa TTY dla interaktywnych programów - Tryb podwyższonych uprawnień dla operacji uprzywilejowanych (tylko host Gateway) ### Przepływy zatwierdzania Wrażliwe polecenia mogą wymagać zatwierdzenia przez użytkownika przed wykonaniem: - **Lista dozwolonych**, Wykonywane są tylko wcześniej zatwierdzone polecenia - **Pytaj**, Nieznane polecenia wymagają zatwierdzenia - **Pełne**, Brak ograniczeń ## Automatyzacja przeglądarki Agenci sterują pełnoprawną przeglądarką opartą na Chromium (Chrome, Brave lub Edge): ### Działania - **Nawiguj**, Otwieraj adresy URL i poruszaj się między stronami - **Interakcja**, Klikaj, pisz, najeżdżaj, przeciągaj, zaznaczaj, wypełniaj formularze - **Przechwytuj**, Wykonuj zrzuty ekranu, eksportuj pliki PDF - **Sprawdzaj**, Pobieraj migawkę drzewa DOM lub drzewa dostępności - **Wykonuj**, Uruchamiaj JavaScript w kontekście strony - **Przesyłaj**, Przesyłaj pliki do formularzy internetowych - **Zarządzaj**, Obsługuj okna dialogowe (alerty, potwierdzenia), odczytuj dane wyjściowe konsoli ### Profile przeglądarki Wiele izolowanych profili przeglądarki do separowania kont: - Każdy profil ma własne pliki cookie, pamięć i historię - Automatycznie przypisywane porty CDP do sterowania programowego - Obsługa zdalnej przeglądarki (łączenie z przeglądarkami na innych maszynach) ## Canvas i A2UI System Agent-to-UI (A2UI) pozwala agentom renderować interaktywne treści wizualne na podłączonych urządzeniach: - **Prezentuj**, Wyświetlaj strony internetowe lub niestandardowe treści na canvasie urządzenia - **Nawiguj**, Kontroluj, co jest wyświetlane w oknie canvas - **Ewaluuj**, Wykonuj JavaScript w kontekście canvas - **Migawka**, Przechwytuj aktualnie wyświetlane treści - **A2UI Push**, Wysyłaj strukturyzowane aktualizacje interfejsu (ładunki JSONL) do canvas - **A2UI Reset**, Czyść stan canvas Renderowanie canvas jest dostępne na macOS (WebKit), iOS (SwiftUI), Android (Jetpack Compose) i web (WebChat). ## Możliwości urządzeń węzłowych Przez podłączone aplikacje towarzyszące agenci mogą: ### Kamera - **Snap**, Robić zdjęcia (przednia lub tylna kamera) - **Clip**, Nagrywać klipy wideo z konfigurowalnym czasem trwania i liczbą klatek ### Ekran - **Record**, Przechwytywać nagrania ekranu z konfigurowalnym czasem trwania i jakością ### Lokalizacja - **Get**, Pobierać współrzędne GPS z wyborem dokładności ### Powiadomienia - **Notify**, Wysyłać natywne powiadomienia systemu operacyjnego z tytułem, treścią i priorytetem ### Polecenia systemowe - **Run**, Wykonywać polecenia powłoki na urządzeniu węzłowym - **Which**, Sprawdzać dostępność polecenia na węźle ## Wiadomości Agenci mogą wysyłać wiadomości i zarządzać nimi w podłączonych kanałach: - **Wyślij**, Wyślij wiadomości do dowolnego podłączonego kanału/odbiorcy - **Edytuj**, Edytuj wcześniej wysłane wiadomości - **Reaguj**, Dodawaj reakcje do wiadomości - **Wątek**, Twórz wątki i odpowiadaj w nich - **Ankieta**, Twórz ankiety na obsługiwanych platformach - **Głos**, Sprawdzaj status kanału głosowego (Discord) ## Internet - **Wyszukaj**, Wyszukiwanie w internecie za pośrednictwem Brave Search API - **Pobierz**, Pobieraj strony internetowe i konwertuj HTML do markdown/tekstu ## Pamięć i kontekst - **Memory Search**, Wyszukiwanie podobieństwa wektorowego w plikach pamięci agenta - **Memory Get**, Pobieranie określonych plików pamięci po nazwie ## Zarządzanie sesjami - **List Sessions**, Przeglądaj aktywne sesje wszystkich agentów - **Session History**, Pobieraj zapis każdej sesji - **Send to Session**, Wysyłaj wiadomości do innych sesji agentów - **Spawn Sub-Agent**, Uruchamiaj izolowane uruchomienia agentów podrzędnych - **List Agents**, Przeglądaj dostępnych agentów ## Automatyzacja - **Cron**, Twórz, edytuj, uruchamiaj i zarządzaj zaplanowanymi zadaniami - **Gateway**, Restartuj Gateway, stosuj zmiany konfiguracji, uruchamiaj aktualizacje ## Analiza obrazów Agenci mogą analizować obrazy przy użyciu skonfigurowanych modeli wizji -- opisywać zawartość, wyodrębniać tekst, identyfikować obiekty i odpowiadać na pytania dotyczące treści wizualnych. ## Grupy narzędzi Narzędzia są zorganizowane w grupy dla łatwego zarządzania uprawnieniami: | Grupa | Narzędzia | |-------|-----------| | **runtime** | exec, bash, process | | **fs** | read, write, edit, apply_patch | | **sessions** | sessions_list, sessions_history, sessions_send, sessions_spawn, session_status | | **memory** | memory_search, memory_get | | **web** | web_search, web_fetch | | **ui** | browser, canvas | | **automation** | cron, gateway | | **messaging** | message | | **nodes** | nodes |