Narzędzia i możliwości
Przegląd
Narzędzia to działania, które Twoi agenci mogą wykonywać podczas rozmów. Gdy agent musi przeglądać internet, uruchomić polecenie, odczytać plik lub sterować urządzeniem, używa narzędzi.
Neotask dostarcza bogaty zestaw wbudowanych narzędzi obejmujących zarządzanie plikami, wykonywanie kodu, automatyzację przeglądarki, sterowanie urządzeniami, obsługę wiadomości, wyszukiwanie w internecie i wiele więcej.
Operacje na plikach
Agenci mogą odczytywać, zapisywać i edytować pliki w swojej przestrzeni roboczej:
- Odczyt, Odczytaj zawartość pliku
- Zapis, Utwórz lub nadpisz pliki
- Edycja, Wprowadzaj ukierunkowane zmiany w określonych częściach pliku
- Zastosuj łatkę, Stosuj wielosekcyjne ujednolicone łatki dla złożonych modyfikacji plików
Wykonywanie kodu
Agenci mogą uruchamiać polecenia powłoki z konfigurowalną izolacją:
- Wykonanie przez Gateway, Uruchamiaj polecenia bezpośrednio na maszynie hostującej Gateway
- Wykonanie w piaskownicy, Uruchamiaj polecenia w izolowanych kontenerach Docker z limitami zasobów
- Wykonanie na węźle, Uruchamiaj polecenia na podłączonych urządzeniach towarzyszących (węzły macOS, Linux)
Funkcje wykonywania
- Konfigurowalne limity czasu (domyślnie 30 minut)
- Zarządzanie zadaniami w tle (lista, odpytywanie, zatrzymywanie, czyszczenie)
- Automatyczne przenoszenie do tła dla długo działających poleceń
- Obsługa TTY dla interaktywnych programów
- Tryb podwyższonych uprawnień dla operacji uprzywilejowanych (tylko host Gateway)
Przepływy zatwierdzania
Wrażliwe polecenia mogą wymagać zatwierdzenia przez użytkownika przed wykonaniem:
- Lista dozwolonych, Wykonywane są tylko wcześniej zatwierdzone polecenia
- Pytaj, Nieznane polecenia wymagają zatwierdzenia
- Pełne, Brak ograniczeń
Automatyzacja przeglądarki
Agenci sterują pełnoprawną przeglądarką opartą na Chromium (Chrome, Brave lub Edge):
Działania
- Nawiguj, Otwieraj adresy URL i poruszaj się między stronami
- Interakcja, Klikaj, pisz, najeżdżaj, przeciągaj, zaznaczaj, wypełniaj formularze
- Przechwytuj, Wykonuj zrzuty ekranu, eksportuj pliki PDF
- Sprawdzaj, Pobieraj migawkę drzewa DOM lub drzewa dostępności
- Wykonuj, Uruchamiaj JavaScript w kontekście strony
- Przesyłaj, Przesyłaj pliki do formularzy internetowych
- Zarządzaj, Obsługuj okna dialogowe (alerty, potwierdzenia), odczytuj dane wyjściowe konsoli
Profile przeglądarki
Wiele izolowanych profili przeglądarki do separowania kont:
- Każdy profil ma własne pliki cookie, pamięć i historię
- Automatycznie przypisywane porty CDP do sterowania programowego
- Obsługa zdalnej przeglądarki (łączenie z przeglądarkami na innych maszynach)
Canvas i A2UI
System Agent-to-UI (A2UI) pozwala agentom renderować interaktywne treści wizualne na podłączonych urządzeniach:
- Prezentuj, Wyświetlaj strony internetowe lub niestandardowe treści na canvasie urządzenia
- Nawiguj, Kontroluj, co jest wyświetlane w oknie canvas
- Ewaluuj, Wykonuj JavaScript w kontekście canvas
- Migawka, Przechwytuj aktualnie wyświetlane treści
- A2UI Push, Wysyłaj strukturyzowane aktualizacje interfejsu (ładunki JSONL) do canvas
- A2UI Reset, Czyść stan canvas
Renderowanie canvas jest dostępne na macOS (WebKit), iOS (SwiftUI), Android (Jetpack Compose) i web (WebChat).
Możliwości urządzeń węzłowych
Przez podłączone aplikacje towarzyszące agenci mogą:
Kamera
- Snap, Robić zdjęcia (przednia lub tylna kamera)
- Clip, Nagrywać klipy wideo z konfigurowalnym czasem trwania i liczbą klatek
Ekran
- Record, Przechwytywać nagrania ekranu z konfigurowalnym czasem trwania i jakością
Lokalizacja
- Get, Pobierać współrzędne GPS z wyborem dokładności
Powiadomienia
- Notify, Wysyłać natywne powiadomienia systemu operacyjnego z tytułem, treścią i priorytetem
Polecenia systemowe
- Run, Wykonywać polecenia powłoki na urządzeniu węzłowym
- Which, Sprawdzać dostępność polecenia na węźle
Wiadomości
Agenci mogą wysyłać wiadomości i zarządzać nimi w podłączonych kanałach:
- Wyślij, Wyślij wiadomości do dowolnego podłączonego kanału/odbiorcy
- Edytuj, Edytuj wcześniej wysłane wiadomości
- Reaguj, Dodawaj reakcje do wiadomości
- Wątek, Twórz wątki i odpowiadaj w nich
- Ankieta, Twórz ankiety na obsługiwanych platformach
- Głos, Sprawdzaj status kanału głosowego (Discord)
Internet
- Wyszukaj, Wyszukiwanie w internecie za pośrednictwem Brave Search API
- Pobierz, Pobieraj strony internetowe i konwertuj HTML do markdown/tekstu
Pamięć i kontekst
- Memory Search, Wyszukiwanie podobieństwa wektorowego w plikach pamięci agenta
- Memory Get, Pobieranie określonych plików pamięci po nazwie
Zarządzanie sesjami
- List Sessions, Przeglądaj aktywne sesje wszystkich agentów
- Session History, Pobieraj zapis każdej sesji
- Send to Session, Wysyłaj wiadomości do innych sesji agentów
- Spawn Sub-Agent, Uruchamiaj izolowane uruchomienia agentów podrzędnych
- List Agents, Przeglądaj dostępnych agentów
Automatyzacja
- Cron, Twórz, edytuj, uruchamiaj i zarządzaj zaplanowanymi zadaniami
- Gateway, Restartuj Gateway, stosuj zmiany konfiguracji, uruchamiaj aktualizacje
Analiza obrazów
Agenci mogą analizować obrazy przy użyciu skonfigurowanych modeli wizji -- opisywać zawartość, wyodrębniać tekst, identyfikować obiekty i odpowiadać na pytania dotyczące treści wizualnych.
Grupy narzędzi
Narzędzia są zorganizowane w grupy dla łatwego zarządzania uprawnieniami:
| Grupa | Narzędzia |
|---|---|
| runtime | exec, bash, process |
| fs | read, write, edit, apply_patch |
| sessions | sessions_list, sessions_history, sessions_send, sessions_spawn, session_status |
| memory | memory_search, memory_get |
| web | web_search, web_fetch |
| ui | browser, canvas |
| automation | cron, gateway |
| messaging | message |
| nodes | nodes |