Tìm hiểu về chế độ Expressive trong ElevenAgents
Mua gói Thành viên QuanTriMang Pro để trải nghiệm website không quảng cáo và sử dụng các tiện ích AI trên QuanTriMang.
Xây dựng các voice agent có khả năng điều chỉnh tông giọng, nhịp độ và cách truyền tải cảm xúc dựa trên ngữ cảnh cuộc trò chuyện.
Tổng quan
Chế độ Expressive cho phép các agent tạo ra giọng nói phản ánh đúng ý định, cảm xúc và sự nhấn nhá, đồng thời thích ứng theo thời gian thực với giọng điệu và nội dung lời nói của người dùng. Chế độ này được xây dựng dựa trên hai cải tiến cấp hệ thống cho quy trình xử lý hội thoại:
- Eleven v3 Conversational - Mô hình chuyển đổi văn bản thành giọng nói (TTS) có khả năng hiểu cảm xúc và ngữ cảnh tốt nhất hiện có trong ElevenAgents.
- Hệ thống luân phiên lượt nói mới - Giúp căn chỉnh thời gian phản hồi chính xác hơn và giảm thiểu tình trạng ngắt lời.
Chế độ Expressive được kích hoạt mặc định khi bạn chọn Eleven v3 Conversational làm mô hình TTS cho agent của mình.
Eleven v3 Conversational
Eleven v3 Conversational là phiên bản có độ trễ cực thấp của Eleven v3, được tối ưu hóa cho các cuộc đối thoại trực tiếp, hai chiều. Mô hình này duy trì ngữ cảnh hội thoại xuyên suốt các lượt nói và điều chỉnh cách thể hiện giọng nói sao cho phù hợp với tông giọng cũng như ý định của từng trao đổi.
- Thể hiện giọng nói dựa trên ngữ cảnh: Agent điều chỉnh tông giọng theo ngữ cảnh hội thoại - ví dụ: phản hồi điềm tĩnh hơn khi người dùng có vẻ lo lắng, hoặc trực diện hơn khi cần sự rõ ràng.
- Kiểm soát cảm xúc chủ động: Điều hướng cách thể hiện giọng nói thông qua các quy tắc trong câu lệnh hệ thống (system prompt) - từ những kích hoạt cụ thể đến các tình huống tổng quát - nhằm đảm bảo sự nhất quán với giọng điệu thương hiệu và những yêu cầu tuân thủ.
- Hỗ trợ hơn 70 ngôn ngữ: Mở rộng từ khoảng 32 ngôn ngữ ở các mô hình Flash, đồng thời cải thiện khả năng diễn cảm đối với những ngôn ngữ trước đây còn hạn chế về sắc thái, bao gồm cả tiếng Nhật.
- Tag Expressive: Mô hình ngôn ngữ lớn (LLM) có thể xuất ra các tag như
[laughs],[whispers]hoặc[sighs]để kiểm soát những khoảnh khắc thể hiện cụ thể.
Eleven v3 Conversational có mức giá tương đương với các mô hình TTS khác của ElevenLabs trong Agents, bắt đầu từ 0,08 USD mỗi phút.
Hệ thống luân phiên lượt nói
Hệ thống luân phiên lượt nói mới sử dụng các tín hiệu thời gian thực từ Scribe v2 Realtime - bao gồm những dấu hiệu cảm xúc và đặc điểm giọng nói - để xác định thời điểm agent nên nói, tạm dừng hoặc chờ đợi. Điều này giúp agent phản hồi tự nhiên hơn, đặc biệt là trong các tình huống giàu cảm xúc.
Ví dụ, từ "ừ" (yeah) có thể mang nghĩa xác nhận hoàn tất hoặc là lời dẫn để tiếp tục nói. Bằng cách phân tích cách từ này được phát âm (các tín hiệu giọng nói như ngữ điệu) kết hợp với nội dung văn bản, hệ thống sẽ căn chỉnh thời gian phản hồi của agent một cách tự nhiên hơn. Hành vi luân phiên lượt nói có thể được tinh chỉnh thêm bằng cài đặt "mức độ sẵn sàng giành lượt nói" (turn eagerness).
Cấu hình
Bật chế độ Expressive
1. Chọn mô hình TTS
Đặt mô hình TTS (Chuyển văn bản thành giọng nói) của agent thành V3 Conversational. Chế độ Expressive được bật mặc định với mô hình này.
Cập nhật qua dashboard
Mở agent của bạn trong dashboard, chuyển đến tab Agent Voice và chọn V3 Conversational làm mô hình TTS. Lưu các thay đổi.
Cập nhật qua CLI
Tải cấu hình agent về
elevenlabs agents pull --agent "<agent-name>"
Chỉnh sửa file agent_configs/<agent-name>.json
Thiết lập conversation_config.tts.model_id:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v4_turbo"
}
}
}
Đẩy các thay đổi của bạn lên
elevenlabs agents push --agent "<agent-name>"
Cập nhật qua API
Python
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="agent_7101k5zvyjhmfg983brhmhkd98n6",
conversation_config={
"tts": {"model_id": "eleven_v4_turbo"},
},
)
TypeScript
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient();
await elevenlabs.conversationalAi.agents.update("agent_7101k5zvyjhmfg983brhmhkd98n6", {
conversationConfig: {
tts: { modelId: "eleven_v4_turbo" },
},
});
2. Hướng dẫn cách thể hiện cảm xúc trong câu lệnh hệ thống (system prompt)
Thêm hướng dẫn vào câu lệnh hệ thống của agent để điều chỉnh cách agent thay đổi giọng điệu. Bạn có thể sử dụng hướng dẫn chung hoặc các tín hiệu kích hoạt cụ thể.
Ví dụ về câu lệnh hệ thống
Hướng dẫn cách thể hiện cảm xúc của agent thông qua các chỉ dẫn bằng ngôn ngữ tự nhiên trong câu lệnh hệ thống. Mô hình sẽ diễn giải các chỉ dẫn này dựa trên ngữ cảnh, vì vậy không cần dùng tag cụ thể cho mọi tình huống.
Hướng dẫn chung
You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.
Bạn là nhân viên hỗ trợ khách hàng. Khi người dùng tỏ ra thất vọng hoặc bực bội, hãy phản hồi
bằng giọng điệu bình tĩnh, trấn an. Khi thông báo tin vui, hãy để giọng điệu thể hiện
sự nồng nhiệt chân thành. Luôn duy trì phong cách chuyên nghiệp nhưng dễ gần.
Tín hiệu kích hoạt cụ thể
You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented
Bạn là một AI agent đàm thoại có khả năng nói biểu cảm.
Hướng dẫn về giọng điệu:
- Khi người dùng bày tỏ sự thất vọng, hãy dùng giọng điệu bình tĩnh và thấu cảm
- Khi giải thích các bước kỹ thuật, hãy nói với tốc độ rõ ràng và vừa phải
- Khi người dùng chia sẻ tin vui, hãy phản hồi với sự nồng nhiệt và hào hứng
- Khi xử lý khiếu nại, hãy giữ thái độ điềm tĩnh và tập trung vào giải pháp
Sử dụng các tag Expressive
Ngoài việc thể hiện giọng nói dựa trên ngữ cảnh, LLM có thể xuất ra các tag cụ thể để kiểm soát những thời điểm nhất định. Các tag phổ biến bao gồm:
[laughs]- Thêm tiếng cười vào lời nói[whispers]- Giảm âm lượng để tạo hiệu ứng thì thầm[sighs]- Thêm âm thanh tiếng thở dài[slow]- Làm chậm tốc độ nói[excited]- Thêm sự hào hứng vào giọng nói
Mỗi tag ảnh hưởng đến khoảng 4-5 từ tiếp theo trước khi quay lại cách nói bình thường.
You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."Bạn cũng có thể sử dụng các tag Expressive trong câu trả lời để kiểm soát sắc thái một cách chính xác:
- [laughs] cho những khoảnh khắc hài hước
- [whispers] cho những khoảnh khắc riêng tư hoặc thân mật
- [sighs] khi thể hiện sự chấp nhận hoặc cảm giác nhẹ nhõm
- [slow] khi muốn nhấn mạnh thông tin quan trọng
Ví dụ: "Thật tuyệt khi nghe điều đó! [laughs] Tôi rất vui vì chúng tôi đã có thể giải quyết vấn đề đó giúp bạn."
Các phương pháp tốt nhất
Điều chỉnh cách truyền đạt phù hợp với ngữ cảnh
Hướng dẫn agent của bạn điều chỉnh cách truyền đạt cảm xúc sao cho phù hợp với tình huống. Một khách hàng đang bực bội nên nhận được phản hồi bình tĩnh, thấu cảm. Một người dùng đang chia sẻ tin tốt nên nhận được sự ấm áp chân thành. Giọng điệu không phù hợp sẽ làm xói mòn lòng tin.
Sử dụng các quy tắc prompt hệ thống để đảm bảo tính nhất quán
Xác định rõ ràng các hướng dẫn về giọng điệu trong prompt hệ thống thay vì chỉ dựa vào phán đoán của mô hình. Điều này đảm bảo cách truyền đạt nhất quán, phù hợp với giọng điệu thương hiệu và các yêu cầu tuân thủ.
Kiểm tra trên nhiều ngôn ngữ
Cách truyền đạt biểu cảm có thể khác nhau giữa các ngôn ngữ. Kiểm tra agent của bạn trên từng ngôn ngữ mục tiêu để đảm bảo sắc thái cảm xúc được truyền tải như mong muốn, đặc biệt là ở những ngôn ngữ có chuẩn mực hội thoại khác nhau.
Kết hợp với cài đặt mức độ nhanh chóng của lượt nói
Kết hợp chế độ Expressive với cài đặt mức độ nhanh chóng của lượt nói phù hợp. Chế độ Patient cho người dùng nhiều không gian hơn trong các cuộc hội thoại nhạy cảm về mặt cảm xúc, trong khi chế độ Eager phù hợp với các tương tác nhanh.
Theo dõi và cải tiến
Sử dụng phân tích hội thoại để theo dõi cách người dùng phản hồi với cách truyền đạt biểu cảm. Tinh chỉnh các hướng dẫn về giọng điệu dựa trên kết quả hội thoại và phản hồi của người dùng.
Hạn chế
- Eleven v3 Conversational không giữ được các đặc điểm của Professional Voice Clones (PVC) - âm thanh đầu ra có thể không giống với giọng nói PVC gốc.
- Các hiệu ứng biểu cảm kéo dài khoảng 4-5 từ trước khi trở lại cách nói bình thường.
- Khả năng biểu cảm có thể khác nhau giữa các giọng nói và ngôn ngữ.
Bạn nên đọc
-
Phê duyệt và tự động kiểm duyệt trong Grok Bot: Xác định nơi các bot cần dừng lại
-
Trình tự đảm bảo tính an toàn cho quy trình tự động hóa trong Grok Bot
-
Cấu hình hành vi kênh (channel) cho ElevenAgents
-
Cách điều chỉnh tốc độ nói của ElevenLabs agent
-
Connector, bằng chứng và hướng dẫn ẩn trong nội dung Grok Bot
-
Cấu hình luồng hội thoại trong ElevenAgents
-
Kiểm soát cách ElevenAgents hoạt động trong môi trường thực tế
-
Kiểm soát cách AI agent phát âm các từ cụ thể trong ElevenAgents
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:
Hướng dẫn AI
AI Tools
Học IT
Hàm Excel