การควบคุมด้วยเสียง
Neotask มีระบบควบคุมด้วยเสียงที่มีฟีเจอร์ครบครันซึ่งช่วยให้คุณโต้ตอบกับเอเจนต์ AI ของคุณผ่านการพูดทั้งหมด คุณสามารถเปิดใช้งานเอเจนต์ ออกคำสั่ง นำทางอินเทอร์เฟซ และรับการตอบกลับด้วยเสียง, ทั้งหมดโดยไม่ต้องใช้มือ
ภาพรวม
วิธีการเปิดใช้งาน
มีสองวิธีในการเปิดใช้งานการป้อนเสียง:
- wake word แบบ always-listening, พูดวลีทริกเกอร์ (เช่น "Hey Neotask") แอปพลิเคชันจะเริ่มฟัง ไม่ต้องกดปุ่ม
- แป้นพิมพ์ลัด, กดคีย์ผสมเพื่อเริ่มการป้อนเสียงตามต้องการ
คุณสามารถเลือกวิธีที่คุณต้องการใน Settings > Wake Mode
ขั้นตอนการโต้ตอบด้วยเสียง
การโต้ตอบด้วยเสียงทุกครั้งเป็นไปตามวงจรนี้:
- ปลุก, การเปิดใช้งานผ่าน wake word หรือแป้นพิมพ์ลัด
- ฟัง, Neotask ฟังการป้อนด้วยเสียงของคุณ
- ถอดเสียง, เสียงพูดถูกแปลงเป็นข้อความแบบ real-time
- คิด, AI ประมวลผลคำขอของคุณและกำหนดการกระทำที่เหมาะสม
- พูด, การตอบสนองถูกพูดออกมาให้คุณโดยใช้ text-to-speech ที่เป็นธรรมชาติ
- ฟัง, ระบบกลับมาฟังคำสั่งต่อไปของคุณ ทำให้การสนทนาดำเนินต่อไปได้อย่างต่อเนื่อง
การเปิดใช้งาน Wake Word
Wake Word เริ่มต้น
wake word เริ่มต้นคือ:
"Hey Neotask"
เพียงพูดวลีนี้ แล้ว Neotask จะเริ่มฟังคำสั่งของคุณ
Wake Word กำหนดเอง
คุณสามารถตั้ง wake word กำหนดเองใน Settings > Wake Word เลือกวลีสั้น ๆ ที่โดดเด่นที่พูดง่ายสำหรับคุณและไม่น่าจะเกิดขึ้นในการสนทนาปกติ
ประสิทธิภาพ
การตรวจจับ wake word รัน บนเครื่องของคุณทั้งหมด, ไม่มีเสียงถูกส่งไปยังคลาวด์สำหรับการประมวลผล wake word เอ็นจินตรวจจับได้รับการปรับให้เหมาะสมสำหรับ การใช้ CPU ต่ำมาก ดังนั้นจึงสามารถทำงานในพื้นหลังได้โดยไม่ส่งผลกระทบต่อประสิทธิภาพระบบ
ความไว
ความไวของ wake word กำหนดค่าได้ หากคุณพบว่า wake word ทริกเกอร์ง่ายเกินไป (false positive) หรือไม่บ่อยพอ (การเปิดใช้งานที่พลาด) ให้ปรับแถบเลื่อนความไวใน Settings > Wake Word > Sensitivity
การเปิดใช้งานด้วยแป้นพิมพ์ลัด
แป้นพิมพ์ลัดเริ่มต้น
| แพลตฟอร์ม | แป้นพิมพ์ลัด |
|---|---|
| macOS | Cmd + Shift + Space |
| Windows / Linux | Ctrl + Shift + Space |
การปรับแต่ง
แป้นพิมพ์ลัดปรับแต่งได้อย่างเต็มที่ ไปที่ Settings > Wake Mode > Keyboard Shortcut เพื่อตั้งคีย์ผสมที่คุณต้องการ
ฟีเจอร์เสียง
Speech-to-Text
Neotask ใช้ Deepgram สำหรับการถอดเสียงพูดเป็นข้อความแบบ real-time คำพูดของคุณปรากฏเป็นข้อความในการสนทนาขณะที่คุณพูด ด้วยความหน่วงต่ำ
Text-to-Speech
การตอบสนองถูกพูดออกเสียงโดยใช้เทคโนโลยี text-to-speech ที่เป็นธรรมชาติของ ElevenLabs คลังเสียงรวมถึง 100+ เสียง ครอบคลุมสไตล์ที่หลากหลาย
การเลือกเสียง
เลือกเสียงที่คุณต้องการใน Settings > Voice คุณสามารถกรองเสียงตาม:
- เพศ, ชาย หญิง หรือเป็นกลาง
- สำเนียง, อเมริกัน อังกฤษ ออสเตรเลีย และอื่น ๆ อีกมาก
- อายุ, หนุ่มสาว วัยกลางคน หรือผู้สูงวัย
ปุ่ม ตัวอย่างเสียง มีให้ถัดจากเสียงแต่ละเสียงเพื่อให้คุณฟังตัวอย่างก่อนเลือก
การควบคุมการสนทนา
- หยุดชั่วคราว, หยุดการสนทนาด้วยเสียงได้ทุกเวลา AI จะหยุดฟังและพูดจนกว่าคุณจะกลับมา
- กลับมา, ดำเนินการสนทนาต่อจากที่คุณหยุดไว้
การแนบไฟล์
คุณสามารถแนบไฟล์ระหว่างเซสชันเสียง ตัวอย่างเช่น พูดว่า "ฉันอยากแชร์ไฟล์" แล้วใช้กล่องโต้ตอบการแนบ หรือลาก-วางไฟล์ลงในหน้าต่างการสนทนาขณะที่โหมดเสียงทำงานอยู่ AI สามารถอ้างอิงและทำงานกับไฟล์ที่แนบได้
คำสั่งเสียง
Neotask เข้าใจคำสั่งภาษาธรรมชาติที่หลากหลาย ต่อไปนี้คือหมวดหมู่ทั่วไปพร้อมตัวอย่าง
เปิดเว็บไซต์
| ตัวอย่างคำสั่ง |
|---|
| "Open YouTube" |
| "Go to github.com" |
| "Open the Neotask documentation" |
ค้นหาเว็บ
| ตัวอย่างคำสั่ง |
|---|
| "Search for Python tutorials on Google" |
| "Look up the weather in San Francisco" |
| "Search Stack Overflow for React hooks" |
เปิดแอปพลิเคชัน
| ตัวอย่างคำสั่ง |
|---|
| "Open Safari" |
| "Launch Finder" |
| "Open Visual Studio Code" |
| "Start Terminal" |
การควบคุมเบราว์เซอร์
| ตัวอย่างคำสั่ง |
|---|
| "Scroll down" |
| "Go back" |
| "Refresh the page" |
| "Scroll to the top" |
การดำเนินการเอเจนต์
| ตัวอย่างคำสั่ง |
|---|
| "Create an agent called Research Assistant" |
| "Start the agent" |
| "Stop the agent" |
| "Show me agent status" |
การรวมหลายคำสั่ง
คุณสามารถรวมคำสั่งหลายรายการในคำสั่งเสียงเดียว:
| ตัวอย่างคำสั่ง |
|---|
| "Create an agent called Data Analyzer, enable voice, and start it" |
| "Open YouTube and search for machine learning tutorials" |
| "Stop the agent and show me the session log" |
การรันเครื่องมือระหว่างการใช้เสียง
เมื่อคำสั่งเสียงของคุณทริกเกอร์เครื่องมือหรือการกระทำ Neotask ให้ ข้อเสนอแนะด้วยเสียงแบบ real-time เพื่อให้คุณทราบว่าเกิดอะไรขึ้น:
- "I'm opening the file editor..."
- "Running the shell command now..."
- "Fetching the web page..."
การกระทำเครื่องมือที่รองรับ
เครื่องมือที่สามารถทริกเกอร์ด้วยเสียงรวมถึง:
- คำสั่งเชลล์, รันคำสั่งเทอร์มินัลบนเครื่องของคุณ
- การดำเนินการไฟล์, สร้าง อ่าน แก้ไข และจัดระเบียบไฟล์
- คำขอเว็บ, ดึงข้อมูลจาก URL และ API
เวิร์กโฟลว์การอนุมัติ
เมื่อเปิดใช้งาน Safe Mode (เปิดใช้งานโดยค่าเริ่มต้น) การกระทำที่ละเอียดอ่อนต้องการการอนุมัติ ด้วยเสียงหรือการคลิกอย่างชัดแจ้งก่อนการรัน การกระทำที่ละเอียดอ่อนรวมถึง:
- การลบไฟล์หรือไดเรกทอรี
- การ deploy โค้ดหรือบริการ
- การส่งข้อความหรืออีเมลในนามของคุณ
AI จะอธิบายการกระทำและขอการยืนยันก่อนดำเนินการต่อ
โหมดสอนคณิตศาสตร์
Neotask มีโหมดสอนคณิตศาสตร์เฉพาะที่รวมการสอนด้วยเสียงกับการแสดงภาพเคลื่อนไหว
วิธีทำงาน
- ถามหัวข้อคณิตศาสตร์, เช่น "Teach me about the unit circle."
- AI สร้าง แผนบทเรียน ที่ปรับให้เหมาะกับหัวข้อ
- การแสดงภาพเคลื่อนไหวถูกเรนเดอร์โดยใช้ Manim (เอ็นจินแอนิเมชันทางคณิตศาสตร์)
- บทเรียนถูกส่งมอบ ทีละส่วน พร้อมคำอธิบายด้วยเสียงที่ซิงค์กับภาพ
เทมเพลตการแสดงภาพ
เทมเพลต built-in ต่อไปนี้มีให้สำหรับบทเรียนเคลื่อนไหวทันที:
| เทมเพลต | คำอธิบาย |
|---|---|
| Unit Circle | การแสดงภาพ unit circle พร้อมป้ายมุมและพิกัด |
| Pythagorean Theorem | แอนิเมชันการพิสูจน์เรขาคณิตพร้อมสี่เหลี่ยมที่มีป้ายบนด้านสามเหลี่ยม |
| Taylor Series | การขยายทีละขั้นตอนที่แสดงการลู่เข้าของการประมาณพหุนาม |
| Quadratic Formula | การอนุมานและการตีความกราฟของราก |
| Sine / Cosine Waves | กราฟคลื่นเคลื่อนไหวพร้อมคำอธิบาย amplitude, period และ phase |
| Derivatives | แอนิเมชันเส้นสัมผัสที่แสดงอัตราการเปลี่ยนแปลงทันที |
| Integrals | แอนิเมชันพื้นที่ใต้กราฟพร้อมการก้าวหน้าของ Riemann sum |
| Graph Functions | พล็อตฟังก์ชันใด ๆ พร้อมแกนที่มีป้าย จุดตัด และฟีเจอร์สำคัญ |
การสอนแบบก้าวหน้า
บทเรียนถูกแบ่งออกเป็นส่วน หลังจากแต่ละส่วน AI จะหยุดและถามว่าคุณพร้อมดำเนินการต่อ ต้องการทบทวน หรือมีคำถามหรือไม่ เพื่อให้แน่ใจว่าคุณเรียนรู้ตามความเร็วของคุณเอง
ภาษาที่รองรับ
Neotask รองรับการโต้ตอบด้วยเสียงใน 21 ภาษา:
| ภาษา | รหัส |
|---|---|
| อังกฤษ | en |
| สเปน | es |
| ฝรั่งเศส | fr |
| เยอรมัน | de |
| อิตาลี | it |
| โปรตุเกส | pt |
| ดัตช์ | nl |
| รัสเซีย | ru |
| จีน (แมนดาริน) | zh |
| ญี่ปุ่น | ja |
| เกาหลี | ko |
| อาหรับ | ar |
| ฮินดี | hi |
| ตุรกี | tr |
| โปแลนด์ | pl |
| สวีเดน | sv |
| เดนมาร์ก | da |
| นอร์เวย์ | no |
| ฟินแลนด์ | fi |
| เช็ก | cs |
| โรมาเนีย | ro |
คุณสามารถเปลี่ยนภาษาเสียงได้ทุกเวลาใน Settings > Language ทั้งการจดจำเสียงและ text-to-speech จะเปลี่ยนเป็นภาษาที่เลือก
Prompt เสียง
Prompt เสียงควบคุมวิธีที่ผู้ช่วย AI ทำงานและตอบสนองระหว่างการสนทนาด้วยเสียง ทั้งสองสามารถแก้ไขได้ใน Settings > Voice Prompts
System Prompt
system prompt กำหนดบุคลิกภาพและพฤติกรรมโดยรวมของผู้ช่วยเสียง มันกำหนดโทน ระดับความเชี่ยวชาญ และสไตล์การโต้ตอบ ตัวอย่างเช่น คุณสามารถสั่งให้ผู้ช่วยกระชับและเป็นเทคนิค หรือเป็นมิตรและพูดคุย
Response Prompt
response prompt ปรับแต่งวิธีที่ผู้ช่วยจัดรูปแบบและส่งมอบการตอบสนองด้วยเสียง ใช้สิ่งนี้เพื่อควบคุมความยาวการตอบสนอง ระดับของรายละเอียด ว่าผู้ช่วยใช้ analogies หรือไม่ และความชอบด้านสไตล์อื่น ๆ
ทั้งสอง prompt รับข้อความอิสระและมีผลทันทีสำหรับการโต้ตอบด้วยเสียงที่ตามมาทั้งหมด