การควบคุมด้วยเสียง

Neotask มีระบบควบคุมด้วยเสียงที่มีฟีเจอร์ครบครันซึ่งช่วยให้คุณโต้ตอบกับเอเจนต์ AI ของคุณผ่านการพูดทั้งหมด คุณสามารถเปิดใช้งานเอเจนต์ ออกคำสั่ง นำทางอินเทอร์เฟซ และรับการตอบกลับด้วยเสียง, ทั้งหมดโดยไม่ต้องใช้มือ


ภาพรวม

วิธีการเปิดใช้งาน

มีสองวิธีในการเปิดใช้งานการป้อนเสียง:

  1. wake word แบบ always-listening, พูดวลีทริกเกอร์ (เช่น "Hey Neotask") แอปพลิเคชันจะเริ่มฟัง ไม่ต้องกดปุ่ม
  2. แป้นพิมพ์ลัด, กดคีย์ผสมเพื่อเริ่มการป้อนเสียงตามต้องการ

คุณสามารถเลือกวิธีที่คุณต้องการใน Settings > Wake Mode

ขั้นตอนการโต้ตอบด้วยเสียง

การโต้ตอบด้วยเสียงทุกครั้งเป็นไปตามวงจรนี้:

  1. ปลุก, การเปิดใช้งานผ่าน wake word หรือแป้นพิมพ์ลัด
  2. ฟัง, Neotask ฟังการป้อนด้วยเสียงของคุณ
  3. ถอดเสียง, เสียงพูดถูกแปลงเป็นข้อความแบบ real-time
  4. คิด, AI ประมวลผลคำขอของคุณและกำหนดการกระทำที่เหมาะสม
  5. พูด, การตอบสนองถูกพูดออกมาให้คุณโดยใช้ text-to-speech ที่เป็นธรรมชาติ
  6. ฟัง, ระบบกลับมาฟังคำสั่งต่อไปของคุณ ทำให้การสนทนาดำเนินต่อไปได้อย่างต่อเนื่อง

การเปิดใช้งาน Wake Word

Wake Word เริ่มต้น

wake word เริ่มต้นคือ:

"Hey Neotask"

เพียงพูดวลีนี้ แล้ว Neotask จะเริ่มฟังคำสั่งของคุณ

Wake Word กำหนดเอง

คุณสามารถตั้ง wake word กำหนดเองใน Settings > Wake Word เลือกวลีสั้น ๆ ที่โดดเด่นที่พูดง่ายสำหรับคุณและไม่น่าจะเกิดขึ้นในการสนทนาปกติ

ประสิทธิภาพ

การตรวจจับ wake word รัน บนเครื่องของคุณทั้งหมด, ไม่มีเสียงถูกส่งไปยังคลาวด์สำหรับการประมวลผล wake word เอ็นจินตรวจจับได้รับการปรับให้เหมาะสมสำหรับ การใช้ CPU ต่ำมาก ดังนั้นจึงสามารถทำงานในพื้นหลังได้โดยไม่ส่งผลกระทบต่อประสิทธิภาพระบบ

ความไว

ความไวของ wake word กำหนดค่าได้ หากคุณพบว่า wake word ทริกเกอร์ง่ายเกินไป (false positive) หรือไม่บ่อยพอ (การเปิดใช้งานที่พลาด) ให้ปรับแถบเลื่อนความไวใน Settings > Wake Word > Sensitivity


การเปิดใช้งานด้วยแป้นพิมพ์ลัด

แป้นพิมพ์ลัดเริ่มต้น

แพลตฟอร์ม แป้นพิมพ์ลัด
macOS Cmd + Shift + Space
Windows / Linux Ctrl + Shift + Space

การปรับแต่ง

แป้นพิมพ์ลัดปรับแต่งได้อย่างเต็มที่ ไปที่ Settings > Wake Mode > Keyboard Shortcut เพื่อตั้งคีย์ผสมที่คุณต้องการ


ฟีเจอร์เสียง

Speech-to-Text

Neotask ใช้ Deepgram สำหรับการถอดเสียงพูดเป็นข้อความแบบ real-time คำพูดของคุณปรากฏเป็นข้อความในการสนทนาขณะที่คุณพูด ด้วยความหน่วงต่ำ

Text-to-Speech

การตอบสนองถูกพูดออกเสียงโดยใช้เทคโนโลยี text-to-speech ที่เป็นธรรมชาติของ ElevenLabs คลังเสียงรวมถึง 100+ เสียง ครอบคลุมสไตล์ที่หลากหลาย

การเลือกเสียง

เลือกเสียงที่คุณต้องการใน Settings > Voice คุณสามารถกรองเสียงตาม:

ปุ่ม ตัวอย่างเสียง มีให้ถัดจากเสียงแต่ละเสียงเพื่อให้คุณฟังตัวอย่างก่อนเลือก

การควบคุมการสนทนา

การแนบไฟล์

คุณสามารถแนบไฟล์ระหว่างเซสชันเสียง ตัวอย่างเช่น พูดว่า "ฉันอยากแชร์ไฟล์" แล้วใช้กล่องโต้ตอบการแนบ หรือลาก-วางไฟล์ลงในหน้าต่างการสนทนาขณะที่โหมดเสียงทำงานอยู่ AI สามารถอ้างอิงและทำงานกับไฟล์ที่แนบได้


คำสั่งเสียง

Neotask เข้าใจคำสั่งภาษาธรรมชาติที่หลากหลาย ต่อไปนี้คือหมวดหมู่ทั่วไปพร้อมตัวอย่าง

เปิดเว็บไซต์

ตัวอย่างคำสั่ง
"Open YouTube"
"Go to github.com"
"Open the Neotask documentation"

ค้นหาเว็บ

ตัวอย่างคำสั่ง
"Search for Python tutorials on Google"
"Look up the weather in San Francisco"
"Search Stack Overflow for React hooks"

เปิดแอปพลิเคชัน

ตัวอย่างคำสั่ง
"Open Safari"
"Launch Finder"
"Open Visual Studio Code"
"Start Terminal"

การควบคุมเบราว์เซอร์

ตัวอย่างคำสั่ง
"Scroll down"
"Go back"
"Refresh the page"
"Scroll to the top"

การดำเนินการเอเจนต์

ตัวอย่างคำสั่ง
"Create an agent called Research Assistant"
"Start the agent"
"Stop the agent"
"Show me agent status"

การรวมหลายคำสั่ง

คุณสามารถรวมคำสั่งหลายรายการในคำสั่งเสียงเดียว:

ตัวอย่างคำสั่ง
"Create an agent called Data Analyzer, enable voice, and start it"
"Open YouTube and search for machine learning tutorials"
"Stop the agent and show me the session log"

การรันเครื่องมือระหว่างการใช้เสียง

เมื่อคำสั่งเสียงของคุณทริกเกอร์เครื่องมือหรือการกระทำ Neotask ให้ ข้อเสนอแนะด้วยเสียงแบบ real-time เพื่อให้คุณทราบว่าเกิดอะไรขึ้น:

การกระทำเครื่องมือที่รองรับ

เครื่องมือที่สามารถทริกเกอร์ด้วยเสียงรวมถึง:

เวิร์กโฟลว์การอนุมัติ

เมื่อเปิดใช้งาน Safe Mode (เปิดใช้งานโดยค่าเริ่มต้น) การกระทำที่ละเอียดอ่อนต้องการการอนุมัติ ด้วยเสียงหรือการคลิกอย่างชัดแจ้งก่อนการรัน การกระทำที่ละเอียดอ่อนรวมถึง:

AI จะอธิบายการกระทำและขอการยืนยันก่อนดำเนินการต่อ


โหมดสอนคณิตศาสตร์

Neotask มีโหมดสอนคณิตศาสตร์เฉพาะที่รวมการสอนด้วยเสียงกับการแสดงภาพเคลื่อนไหว

วิธีทำงาน

  1. ถามหัวข้อคณิตศาสตร์, เช่น "Teach me about the unit circle."
  2. AI สร้าง แผนบทเรียน ที่ปรับให้เหมาะกับหัวข้อ
  3. การแสดงภาพเคลื่อนไหวถูกเรนเดอร์โดยใช้ Manim (เอ็นจินแอนิเมชันทางคณิตศาสตร์)
  4. บทเรียนถูกส่งมอบ ทีละส่วน พร้อมคำอธิบายด้วยเสียงที่ซิงค์กับภาพ

เทมเพลตการแสดงภาพ

เทมเพลต built-in ต่อไปนี้มีให้สำหรับบทเรียนเคลื่อนไหวทันที:

เทมเพลต คำอธิบาย
Unit Circle การแสดงภาพ unit circle พร้อมป้ายมุมและพิกัด
Pythagorean Theorem แอนิเมชันการพิสูจน์เรขาคณิตพร้อมสี่เหลี่ยมที่มีป้ายบนด้านสามเหลี่ยม
Taylor Series การขยายทีละขั้นตอนที่แสดงการลู่เข้าของการประมาณพหุนาม
Quadratic Formula การอนุมานและการตีความกราฟของราก
Sine / Cosine Waves กราฟคลื่นเคลื่อนไหวพร้อมคำอธิบาย amplitude, period และ phase
Derivatives แอนิเมชันเส้นสัมผัสที่แสดงอัตราการเปลี่ยนแปลงทันที
Integrals แอนิเมชันพื้นที่ใต้กราฟพร้อมการก้าวหน้าของ Riemann sum
Graph Functions พล็อตฟังก์ชันใด ๆ พร้อมแกนที่มีป้าย จุดตัด และฟีเจอร์สำคัญ

การสอนแบบก้าวหน้า

บทเรียนถูกแบ่งออกเป็นส่วน หลังจากแต่ละส่วน AI จะหยุดและถามว่าคุณพร้อมดำเนินการต่อ ต้องการทบทวน หรือมีคำถามหรือไม่ เพื่อให้แน่ใจว่าคุณเรียนรู้ตามความเร็วของคุณเอง


ภาษาที่รองรับ

Neotask รองรับการโต้ตอบด้วยเสียงใน 21 ภาษา:

ภาษา รหัส
อังกฤษ en
สเปน es
ฝรั่งเศส fr
เยอรมัน de
อิตาลี it
โปรตุเกส pt
ดัตช์ nl
รัสเซีย ru
จีน (แมนดาริน) zh
ญี่ปุ่น ja
เกาหลี ko
อาหรับ ar
ฮินดี hi
ตุรกี tr
โปแลนด์ pl
สวีเดน sv
เดนมาร์ก da
นอร์เวย์ no
ฟินแลนด์ fi
เช็ก cs
โรมาเนีย ro

คุณสามารถเปลี่ยนภาษาเสียงได้ทุกเวลาใน Settings > Language ทั้งการจดจำเสียงและ text-to-speech จะเปลี่ยนเป็นภาษาที่เลือก


Prompt เสียง

Prompt เสียงควบคุมวิธีที่ผู้ช่วย AI ทำงานและตอบสนองระหว่างการสนทนาด้วยเสียง ทั้งสองสามารถแก้ไขได้ใน Settings > Voice Prompts

System Prompt

system prompt กำหนดบุคลิกภาพและพฤติกรรมโดยรวมของผู้ช่วยเสียง มันกำหนดโทน ระดับความเชี่ยวชาญ และสไตล์การโต้ตอบ ตัวอย่างเช่น คุณสามารถสั่งให้ผู้ช่วยกระชับและเป็นเทคนิค หรือเป็นมิตรและพูดคุย

Response Prompt

response prompt ปรับแต่งวิธีที่ผู้ช่วยจัดรูปแบบและส่งมอบการตอบสนองด้วยเสียง ใช้สิ่งนี้เพื่อควบคุมความยาวการตอบสนอง ระดับของรายละเอียด ว่าผู้ช่วยใช้ analogies หรือไม่ และความชอบด้านสไตล์อื่น ๆ

ทั้งสอง prompt รับข้อความอิสระและมีผลทันทีสำหรับการโต้ตอบด้วยเสียงที่ตามมาทั้งหมด