Cách chọn mô hình AI phù hợp trong ElevenAgents

ElevenAgents cung cấp một giao diện thống nhất để kết nối agent của bạn với nhiều mô hình và nhà cung cấp khác nhau, mang lại sự linh hoạt, độ tin cậy và khả năng tối ưu hóa chi phí.

Các tính năng chính

  • Truy cập thống nhất: Chuyển đổi giữa các nhà cung cấp và mô hình với mức độ thay đổi mã nguồn tối thiểu
  • Độ tin cậy cao: Tự động chuyển đổi sang nhà cung cấp khác nếu nhà cung cấp hiện tại gặp sự cố
  • Theo dõi chi phí: Giám sát chi phí sử dụng trên các mô hình khác nhau

Các mô hình được hỗ trợ

Hiện tại, các mô hình sau đây được hỗ trợ trực tiếp và có thể được cấu hình thông qua phần cài đặt agent:

Nhà cung cấp Mô hình
ElevenLabs Qwen3.6-35B-A3B
Qwen3.5-397B-A17B
Google Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAI GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
Anthropic Claude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

Giá cả thường được tính theo đơn vị USD cho mỗi 1 triệu token, trừ khi có quy định khác. Token là đơn vị dữ liệu văn bản cơ bản đối với các mô hình ngôn ngữ lớn (LLM), trung bình tương đương với khoảng 4 ký tự.

LLM tùy chỉnh

Hệ thống hỗ trợ sử dụng LLM tùy chỉnh của riêng bạn thông qua việc chỉ định endpoint để gửi yêu cầu và cung cấp thông tin xác thực qua hệ thống lưu trữ bảo mật của ElevenLabs.

Một số mô hình sẽ không khả dụng khi tính năng lưu trữ dữ liệu tại EU (EU data residency) được kích hoạt. 

Lựa chọn mô hình

Việc chọn LLM phù hợp nhất cho ứng dụng của bạn đòi hỏi phải cân nhắc một số yếu tố:

  • Độ phức tạp của tác vụ: Đánh giá các mô hình dựa trên các tác vụ tiêu biểu trong ứng dụng của bạn.
  • Yêu cầu về độ trễ: Đối với các cuộc hội thoại thoại trực tiếp, hãy chọn mô hình có độ trễ thấp và đo lường thời gian phản hồi dựa trên những câu lệnh (prompt) và công cụ của bạn.
  • Kích thước cửa sổ ngữ cảnh: Nếu ứng dụng cần xử lý, hiểu hoặc truy xuất thông tin từ các cuộc hội thoại dài hoặc tài liệu đồ sộ, hãy chọn các mô hình có cửa sổ ngữ cảnh lớn hơn.
  • Hiệu quả chi phí: Cân đối giữa hiệu suất và tính năng mong muốn với ngân sách của bạn. Giá LLM có thể chênh lệch đáng kể, vì vậy hãy phân tích cơ cấu giá (token đầu vào, đầu ra và cache) dựa trên mô hình sử dụng dự kiến.
  • Tuân thủ HIPAA: Nếu ứng dụng của bạn liên quan đến Thông tin Y tế Được bảo vệ (PHI), điều quan trọng là phải sử dụng LLM được chứng nhận tuân thủ HIPAA và đảm bảo toàn bộ quy trình xử lý dữ liệu của bạn đáp ứng các tiêu chuẩn quy định.

Kích thước tối đa của câu lệnh hệ thống (system prompt) là 2MB, bao gồm các hướng dẫn cho agent, nội dung cơ sở tri thức và các ngữ cảnh cấp hệ thống khác.

Cấu hình mô hình

Temperature (Độ ngẫu nhiên)

Tham số Temperature kiểm soát tính ngẫu nhiên trong phản hồi của mô hình. Giá trị thấp tạo ra kết quả đầu ra nhất quán và tập trung hơn, trong khi giá trị cao làm tăng tính sáng tạo và sự đa dạng.

  • Thấp (0.0-0.3): Phản hồi mang tính xác định và nhất quán, phù hợp cho các tương tác có cấu trúc.
  • Trung bình (0.4-0.7): Cân bằng giữa tính sáng tạo và tính nhất quán.
  • Cao (0.8-1.0): Phản hồi sáng tạo và đa dạng, phù hợp cho các cuộc hội thoại linh hoạt.

Cấu hình LLM dự phòng

Thiết lập các LLM dự phòng để đảm bảo tính liên tục của cuộc hội thoại khi LLM chính gặp sự cố hoặc không khả dụng. Các tùy chọn cấu hình:

  • Mặc định: Sử dụng trình tự dự phòng do ElevenLabs khuyến nghị
  • Tùy chỉnh: Tự xác định trình tự các mô hình dự phòng
  • Đã tắt: Không sử dụng dự phòng (không khuyến khích cho môi trường thực tế/production)

Việc tắt các LLM dự phòng đồng nghĩa với việc cuộc hội thoại sẽ kết thúc đột ngột nếu LLM chính gặp lỗi hoặc không khả dụng. Hành động này không được khuyến khích cho môi trường thực tế.

Khả năng suy luận (Reasoning)

Khả năng suy luận giúp agent xử lý các quyết định phức tạp, chẳng hạn như lựa chọn công cụ, áp dụng chính sách hoặc hoàn thành quy trình làm việc gồm nhiều bước. Tùy thuộc vào mô hình, bạn có thể kiểm soát mức độ suy luận thông qua "ngân sách suy luận" (thinking budget) hoặc "mức độ nỗ lực suy luận" (reasoning effort).

Ngân sách suy luận

Thiết lập số lượng token suy luận tối đa bằng thanh trượt số. Ngân sách lớn hơn có thể làm tăng thời gian phản hồi. Hãy đặt ngân sách là 0 để tắt quá trình suy luận (nếu mô hình cho phép).

Mức độ nỗ lực suy luận

Mức độ nỗ lực suy luận kiểm soát khối lượng suy luận mà mô hình thực hiện trước khi đưa ra câu trả lời. Các mức độ khả dụng sẽ phụ thuộc vào mô hình được chọn.

Hãy bắt đầu với ngân sách hoặc mức độ nỗ lực thấp hơn đối với các live voice agent vì việc suy luận thêm có thể gây trễ trong quá trình luân phiên hội thoại. Hãy tăng các thông số này đối với những bước quy trình đòi hỏi quyết định phức tạp hơn.

Tóm tắt suy luận (Reasoning summary)

Bật tính năng Reasoning summary để ghi lại phần suy luận của mô hình khi gỡ lỗi các phản hồi, lệnh gọi công cụ hoặc đường dẫn quy trình. Bạn có thể bật tính năng này trong phần cài đặt LLM của agent hoặc thiết lập tham số enable_reasoning_summary thông qua API. Theo mặc định, tính năng này đang tắt.

Nội dung suy luận sẽ tuân theo các cài đặt về lưu trữ và ẩn thông tin định danh cá nhân (PII). Bạn có thể truy cập nội dung này qua các kênh sau:

Đích đến Tình trạng sẵn có
Lịch sử trò chuyện Có sẵn trong mục Reasoning
Lấy API hội thoại Được trả về trong trường reasoning của mục transcript
OpenTelemetry Bao gồm trong khoảng thời gian phản hồi của agent sau cuộc gọi như elevenlabs.reasoning_content
Các sự kiện client Có sẵn dưới dạng agent_reasoning_response_part chỉ trong các cuộc trò chuyện bằng văn bản

Với Zero Retention Mode, ElevenLabs không lưu lại nội dung suy luận. Nội dung này chỉ được gửi đến các ứng dụng chat và webhook sau cuộc gọi.

Các hạn chế

  • Việc yêu cầu tóm tắt suy luận có thể làm tăng độ trễ phản hồi. Hãy thử nghiệm tính năng này trước khi kích hoạt trên các voice agent yêu cầu độ trễ thấp.
  • Các nhà cung cấp có thể trả về bản tóm tắt, văn bản thể hiện suy nghĩ, các thay đổi suy luận thô hoặc không có nội dung hiển thị được.

Hiểu về cách tính phí

  • Token: Việc sử dụng LLM thường được tính phí dựa trên số lượng token được xử lý. Theo quy tắc chung đối với văn bản tiếng Anh, 100 token tương đương với khoảng 75 từ.
  • Phí đầu vào (input) và đầu ra (output): Các nhà cung cấp thường phân biệt mức giá cho token đầu vào (dữ liệu bạn gửi cho mô hình) và token đầu ra (dữ liệu mô hình tạo ra để phản hồi).
  • Chi phí cache:
    • input_cache_read: Đây là chi phí liên quan đến việc truy xuất dữ liệu đầu vào đã được xử lý trước đó từ cache. Việc sử dụng dữ liệu trong cache có thể giúp tiết kiệm chi phí nếu cùng một dữ liệu đầu vào được xử lý nhiều lần.
    • input_cache_write: Đây là chi phí liên quan đến việc lưu trữ dữ liệu input vào cache. Một số nhà cung cấp LLM có thể tính phí cho thao tác này.
  • Giá được liệt kê trong tài liệu này được tính trên mỗi 1 triệu token và dựa trên thông tin có sẵn tại thời điểm viết bài. Các mức giá này có thể thay đổi tùy theo quyết định của nhà cung cấp LLM.

Để biết thông tin về khả năng của mô hình, giá cả và điều khoản dịch vụ hiện tại, vui lòng tham khảo tài liệu của nhà cung cấp.

Các mô hình do ElevenLabs host

ElevenLabs cung cấp quyền truy cập vào nhiều mô hình AI khác nhau, bao gồm cả các mô hình chọn lọc của bên thứ ba do ElevenLabs host.

Khi một mô hình được gắn nhãn là "Hosted by ElevenLabs" (do ElevenLabs host), mô hình đó sẽ được triển khai và vận hành trên cơ sở hạ tầng do ElevenLabs quản lý. Các mô hình này hiện được lưu trữ tại Hoa Kỳ hoặc tại khu vực triển khai hệ thống của doanh nghiệp bạn.

Cách nhận biết các mô hình do ElevenLabs host

Các mô hình do ElevenLabs host được gắn nhãn rõ ràng trên giao diện của ElevenLabs. Hãy tìm dòng chữ “Hosted by ElevenLabs” khi duyệt hoặc chọn các mô hình.

Cách thức xử lý dữ liệu của bạn

Đối với các mô hình do ElevenLabs host, các yêu cầu được xử lý trong cơ sở hạ tầng do ElevenLabs quản lý. Điều này có nghĩa là nhà cung cấp mô hình gốc sẽ không nhận, truy cập hay xử lý các dữ liệu đầu vào và đầu ra được gửi thông qua ElevenLabs.

Việc host các mô hình này cho phép ElevenLabs mang lại trải nghiệm nhất quán, đồng thời duy trì quyền kiểm soát đối với cơ sở hạ tầng dùng để xử lý các yêu cầu gửi đến mô hình.

Thứ Năm, 01/10/2026 09:54
5 ★ 1 👨
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo