Giọng nói

Tổng quan

Neotask hỗ trợ tương tác giọng nói qua nhiều hệ thống: phát hiện từ đánh thức, cuộc trò chuyện giọng nói liên tục (chế độ nói chuyện) và chuyển văn bản thành giọng nói cho các phản hồi bằng lời.

Từ đánh thức

Swabble (macOS)

Swabble là daemon macOS gốc cung cấp phát hiện từ đánh thức giọng nói trên thiết bị luôn bật bằng cách sử dụng Speech.framework của Apple.

Tính năng:

Cách hoạt động:

  1. Swabble lắng nghe liên tục bằng micrô hệ thống
  2. Khi nó phát hiện từ đánh thức trong văn bản nói, nó thu âm lời nói tiếp theo
  3. Văn bản đã thu được gửi đến tác nhân của bạn qua lệnh hook được cấu hình
  4. Tác nhân xử lý lệnh giọng nói và phản hồi

Từ đánh thức node

Trên các ứng dụng đồng hành iOS và Android, đánh thức giọng nói được xử lý gốc:

Chế độ nói chuyện

Chế độ nói chuyện cho phép các cuộc trò chuyện giọng nói liên tục, nói tự nhiên và nghe tác nhân của bạn phản hồi.

Cách hoạt động

  1. Giọng nói thành văn bản, Giọng nói của bạn được phiên âm theo thời gian thực (phát trực tuyến Deepgram hoặc STT gốc nền tảng)
  2. Xử lý tác nhân, Văn bản đã phiên âm được gửi đến tác nhân của bạn như một tin nhắn thông thường
  3. Văn bản thành giọng nói, Phản hồi của tác nhân được nói lại cho bạn

Máy trạng thái giọng nói

Chế độ nói chuyện chuyển đổi giữa bốn trạng thái:

Trạng thái Mô tả
Rảnh Không lắng nghe tích cực
Lắng nghe Đang thu và phiên âm giọng nói của bạn
Suy nghĩ Tác nhân đang xử lý yêu cầu của bạn
Nói Phản hồi tác nhân đang được nói

Nhà cung cấp chuyển văn bản thành giọng nói

Nhà cung cấp Mô tả
ElevenLabs Tổng hợp giọng nói chất lượng cao với lựa chọn giọng nói
OpenAI TTS API chuyển văn bản thành giọng nói của OpenAI

Tùy chọn giọng nói

Lệnh giọng nói

Phát hiện đa ý định

Các tác nhân có thể phát hiện và thực thi các lệnh giọng nói nhiều bước:

"Tạo sự kiện lịch cho ngày mai lúc 3 giờ chiều, sau đó gửi email cho nhóm về điều đó, và đăng lời nhắc trong Slack"

Điều này được tự động phân tích thành một chuỗi lệnh, mỗi lệnh được thực thi theo thứ tự với các kết quả chảy sang bước tiếp theo.

Thực thi công cụ

Trong các cuộc trò chuyện giọng nói, các tác nhân có thể thực thi các công cụ giống như trong các cuộc trò chuyện văn bản, duyệt web, chạy mã, quản lý tệp, điều khiển thiết bị và nhiều hơn nữa. Kết quả được tóm tắt và nói lại.

Thực thi sự thật hành động

Chế độ giọng nói bao gồm xác thực rằng các tuyên bố của tác nhân khớp với kết quả công cụ thực tế. Nếu tác nhân nói "Tôi đã gửi email" nhưng công cụ email thất bại, hệ thống phát hiện sự không nhất quán và báo cáo kết quả thực tế.

Cuộc gọi giọng nói (Plugin)

Plugin Cuộc gọi giọng nói thêm hỗ trợ điện thoại SIP:

Quản lý hạn ngạch

Các dịch vụ giọng nói có thể có hạn ngạch sử dụng: