Your AI Connector Docs

Mô hình AI & BYOK

Trang này giải thích mô hình AI nào vận hành bot của bạn, lý do tại sao chỉ một nhà cung cấp được hỗ trợ cho BYOK (Bring Your Own Key - Sử dụng khóa riêng của bạn), và cách thiết lập khóa riêng nếu gói dịch vụ của bạn bao gồm tính năng này.


Mô hình AI nào vận hành Bot

Nền tảng sử dụng Anthropic Claude làm mô hình chính cho bot của bạn. Claude được lựa chọn vì sau khi thử nghiệm rộng rãi trên mọi mô hình tiên phong (thuật ngữ trong ngành chỉ các mô hình AI tiên tiến nhất hiện có) trên thị trường, đây là mô hình duy nhất xử lý khối lượng tin nhắn sản xuất một cách đáng tin cậy.

Bạn không cần phải chọn mô hình. Nền tảng tự động chọn mô hình phù hợp cho từng tác vụ và tối ưu hóa cách sử dụng ở phía sau (bao gồm cả tính năng bộ nhớ đệm nhắc lệnh nâng cao, giúp giảm đáng kể chi phí cho mỗi cuộc hội thoại).


Tại sao chỉ hỗ trợ Anthropic cho BYOK

Khách hàng thường hỏi liệu chúng tôi có thêm hỗ trợ cho OpenAI, Google Gemini, OpenRouter hoặc các mô hình mã nguồn mở cho BYOK hay không. Câu trả lời thành thật là: không có mô hình nào trong số đó, khi sử dụng ở dạng thô và chưa được tối ưu hóa, có thể đáp ứng được khối lượng công việc thực tế.

Đối với một dự án nhỏ, tỷ lệ thành công 9/10 từ AI là ổn. Khi bạn bắt đầu thực hiện các cuộc hội thoại thực tế với khách hàng ở quy mô lớn, tỷ lệ thất bại 10% đồng nghĩa với việc đặt lịch bị hỏng, câu trả lời sai, bỏ lỡ theo dõi và mất doanh số. Đó là mức độ mà chúng tôi thấy ngay cả ở các mô hình tiên phong hàng đầu từ các nhà cung cấp khác (khoảng 6–10% đối với các trường hợp biên đối nghịch, nghĩa là các câu hỏi kiểm tra khó, cố tình gây khó dễ) — và đó là chưa tính đến các mô hình rẻ hơn.

Các vấn đề được chia thành ba nhóm:

  • Các trường hợp ngoại lệ gây lỗi không thể đoán trước. Một mô hình có thể hoạt động hoàn hảo trong hàng trăm cuộc trò chuyện, sau đó đột nhiên tạo ra ảo giác về lệnh gọi công cụ, khẳng định đã thực hiện điều gì đó mà nó không làm, hoặc bỏ qua các hướng dẫn giữa cuộc hội thoại.
  • Ngữ cảnh dài được xử lý kém. Một phản hồi đơn lẻ của bot sử dụng lịch sử trò chuyện, câu hỏi thường gặp, logic theo dõi, lệnh gọi công cụ và suy luận. Hầu hết các mô hình đều bị quá tải với khối lượng này và tạo ra kết quả đầu ra kém hơn.
  • “Rẻ hơn” hiếm khi thực sự rẻ. Mức giá niêm yết thấp hơn trên mỗi token bị bù đắp bởi việc phải thử lại nhiều hơn, nhiều token đầu ra hơn và tỷ lệ chuyển đổi kém hơn. Chi phí thực tế cho mỗi cuộc hội thoại thành công cuối cùng lại cao hơn.

Việc hỗ trợ 100 mô hình khác nhau giống như một chiêu trò tiếp thị hơn là một khả năng thực tế. Chúng tôi thà cung cấp cho bạn một nhà cung cấp hoạt động đáng tin cậy còn hơn là năm nhà cung cấp mà mỗi cái lại hỏng theo những cách khác nhau.


Mô hình của riêng chúng tôi: Max

Chúng tôi đã xây dựng mô hình nội bộ của riêng mình, Max — một mô hình nội bộ kết hợp với ngăn xếp tối ưu hóa đa lượt, được tinh chỉnh dựa trên dữ liệu hội thoại thực tế từ nền tảng. Mục tiêu là tạo ra một mô hình tiết kiệm chi phí hơn đáng kể so với Claude trong khi vẫn duy trì độ tin cậy trên các kiểu hội thoại mà nền tảng thực sự vận hành, và đó chính là những gì Max mang lại: chỉ bằng một phần nhỏ giá của gói Pro (0,25 tín dụng mỗi hành động), được tinh chỉnh để duy trì độ chính xác ở những nơi mà một mô hình ngân sách thông thường có thể sai sót.

Max không cần thiết lập — không cần chọn mô hình, không cần tài khoản nhà cung cấp, không cần khóa. Nó chạy hoàn toàn trên cơ sở hạ tầng của chúng tôi và là mô hình chính xác nhất mà chúng tôi cung cấp: trong các bài kiểm tra điểm chuẩn của riêng chúng tôi, nó là mô hình mạnh nhất trong việc bám sát những gì doanh nghiệp của bạn thực sự nói. Để biết phân tích đầy đủ về cách Max so sánh với Claude và các mô hình bên thứ ba giá rẻ mà khách hàng thường hỏi — bao gồm cả những gì các mô hình đó thực sự làm sai trong quá trình thử nghiệm của chúng tôi — hãy xem Tại sao Max là lựa chọn tốt nhất.

Ai có thể thấy gói Max

Nếu bộ chọn Chất lượng AI trên tab Hướng dẫn AI của Tác nhân (Agent) chỉ hiển thị ProEconomy, thì đơn giản là Max chưa được bật cho tài khoản bạn đang đăng nhập. Có hai điều giúp bật tính năng này:

  • Các tài khoản thuộc gói trọn đời đủ điều kiện sẽ tự động nhận được Max.
  • Bất kỳ tài khoản nào khác cần phải được kích hoạt Max một cách rõ ràng.

Đối với tài khoản do đại lý cung cấp, nhà cung cấp của bạn có thể đã chọn sẵn mô hình cho bạn. Nếu bộ chọn Chất lượng AI chỉ hiển thị một thẻ và không có gì để chuyển đổi, đó là cài đặt có chủ đích trên tài khoản của bạn, không phải lỗi — hãy yêu cầu người cung cấp tài khoản của bạn thay đổi cài đặt đó. Nếu một thẻ vẫn được hiển thị kèm theo ghi chú rằng thẻ đó không còn khả dụng nữa, thì Tác nhân của bạn đang sử dụng một mô hình mà nhà cung cấp đã xóa kể từ đó: nó vẫn tiếp tục phản hồi, nhưng trên một trong các mô hình mà họ cho phép, vì vậy hãy chọn một trong số đó để bộ chọn khớp với những gì thực sự đang chạy.

Việc kết nối khóa Anthropic của riêng bạn (BYOK) không liên quan đến việc Max có hiển thị hay không. Hai tính năng này hoạt động song song — hãy xem ghi chú ngoại lệ trong phần Thiết lập BYOK để biết cách tính phí Tác nhân Max khi bạn đã kết nối khóa. Việc xóa khóa API của bạn sẽ không làm Max xuất hiện.

Gói Mini

Nếu bạn có thể thấy Max, bạn cũng có thể thấy Mini, với mức giá 0,15 tín dụng cho mỗi hành động. Mini là cùng một AI với Max nhưng ở mức giá thấp hơn, với hai sự đánh đổi:

  • Khả năng xảy ra sai sót cao hơn. Mini là mô hình nhẹ hơn trong hai mô hình. Max là mô hình chính xác nhất mà chúng tôi cung cấp — được tinh chỉnh kỹ lưỡng nhất để bám sát vào những gì doanh nghiệp của bạn thực sự nói — trong khi với Mini, khả năng xảy ra sai sót nhỏ hoặc hiện tượng ảo giác trong phản hồi sẽ cao hơn.
  • Bộ nhớ nhẹ hơn. Trong các cuộc hội thoại dài, Mini ghi nhớ ít tin nhắn cũ hơn và truy xuất ít đoạn trích từ cơ sở kiến thức hơn cho mỗi phản hồi.

Max vẫn là lựa chọn được khuyến nghị cho bất kỳ trường hợp nào mà một chi tiết sai lệch có thể làm mất doanh số — như đặt lịch, câu hỏi về giá cả, hỗ trợ khách hàng có tính chất quan trọng. Mini phù hợp với các cuộc hội thoại có khối lượng lớn, nhạy cảm về giá, nơi tốc độ và chi phí quan trọng hơn một vài phần trăm độ chính xác cuối cùng.

Mini nằm trong cùng bộ chọn Chất lượng AI với Max, trên mọi tài khoản có Max. Giống như Max, Mini chạy hoàn toàn trên cơ sở hạ tầng của chúng tôi và không bao giờ sử dụng khóa BYOK, vì vậy khóa Anthropic được kết nối sẽ không được sử dụng (và không bị tính phí) khi một Tác nhân đang ở chế độ Mini.

Mức phí 0.15 của Mini bao gồm những gì. Giá của Mini áp dụng cho mọi hoạt động diễn ra trong một cuộc trò chuyện trực tiếp: phản hồi của AI, lệnh gọi công cụ của AI (như đặt lịch hẹn hoặc thông báo cho nhân viên), đánh giá trò chuyện (quyết định xem một cuộc trò chuyện có nên bị bỏ qua hoặc đóng lại hay không), xử lý ngắt quãng (khi một liên hệ gửi tin nhắn mới trong khi bot vẫn đang soạn phản hồi), tóm tắt trò chuyện và tự động gắn thẻ bằng AI. Các tính năng AI dùng một lần bên ngoài cuộc trò chuyện — tối ưu hóa chiến dịch, tạo cơ sở kiến thức và gắn thẻ thông qua API — có mức phí cố định là 0.25 tín dụng cho cả Max và Mini, vì vậy bạn có thể thấy các mục 0.25 xuất hiện trong lịch sử tín dụng của mình ngay cả khi mọi Tác nhân (Agent) đều được đặt ở chế độ Mini. Đó là các tính năng đó, chứ không phải do mô hình Max trả lời các cuộc trò chuyện của bạn.


Thiết lập BYOK

BYOK được bao gồm trong các gói AgencyAgency Unlimited, và từ Plan 2 trở lên trên các gói trọn đời của AppSumo. Tính năng này không có trong gói Business. Nếu gói của bạn bao gồm tính năng này, bạn có thể kết nối khóa API Anthropic của riêng mình (một mã riêng tư từ tài khoản Anthropic của bạn cho phép nền tảng tính phí sử dụng AI trực tiếp cho bạn thay vì sử dụng tín dụng của nền tảng).

Chỉ các khóa chính thức của Anthropic mới hoạt động. Một khóa hợp lệ đến từ tài khoản của chính bạn tại console.anthropic.com và luôn bắt đầu bằng sk-ant-. Các khóa từ đại lý, proxy hoặc các trang web “API Claude giảm giá” (thường bắt đầu bằng tiền tố khác) không được hỗ trợ và sẽ không lưu được. Hãy cẩn thận với các ưu đãi về token Claude giá rẻ thấp hơn nhiều so với giá của chính Anthropic — không ai có thể bán lại quyền truy cập Claude một cách hợp pháp với giá thấp hơn mức Anthropic tính phí, và những ưu đãi đó hầu như luôn là lừa đảo dựa trên các khóa bị đánh cắp hoặc được thiết lập để lấy cắp thông tin thanh toán của bạn.

Bạn đang dùng điện thoại? Thanh bên trái có thể bị ẩn. Hãy nhấn vào biểu tượng menu () trước, sau đó nhấn vào Settings.

Bạn không thấy Khóa API BYOK trong nhóm Nâng cao? Phần này chỉ xuất hiện trên các gói có bao gồm BYOK. Nếu tài khoản của bạn do nhà cung cấp quản lý, phần này chỉ xuất hiện khi họ đã bật Sử dụng Khóa API của riêng bạn (Bring Your Own API Key) cho tài khoản của bạn.

  1. Trong thanh bên trái chính, nhấp vào Settings (biểu tượng bánh răng gần cuối).
  2. Trên trang Settings, trong menu bên trái, cuộn xuống nhóm Advanced.
  3. Nhấp vào BYOK API Keys.
  1. Nhấp vào Add key (Thêm khóa) trên thẻ Anthropic. Một trường Secret key (Khóa bí mật) sẽ xuất hiện (trình giữ chỗ sk-ant-…).
  1. Dán khóa API Anthropic của bạn vào trường này, sau đó nhấp vào Save key (Lưu khóa).

Sau khi được kích hoạt, bot của bạn sẽ sử dụng khóa riêng của bạn cho các lệnh gọi AI và bạn sẽ thanh toán trực tiếp cho Anthropic cho mức sử dụng đó thay vì tiêu tốn tín dụng (credits) của nền tảng cho các phản hồi AI. Cơ sở hạ tầng kênh (máy chủ WhatsApp Web, số điện thoại, v.v.) vẫn tiếp tục sử dụng tín dụng như bình thường.

Một ngoại lệ — cấp độ Max. Nếu Chất lượng AI của Tác nhân được đặt thành cấp độ Max, Tác nhân đó chạy hoàn toàn trên cơ sở hạ tầng nội bộ của chúng tôi và được tính phí 0,25 tín dụng cho mỗi hành động ngay cả khi bạn đã kết nối BYOK — Max không bao giờ sử dụng khóa Anthropic của bạn. (Điều tương tự cũng áp dụng cho Mini, nếu có: 0,15 tín dụng cho mỗi hành động, không bao giờ dùng khóa của bạn.) Để tính phí phản hồi vào tài khoản Anthropic của riêng bạn, hãy giữ Tác nhân ở cấp độ Pro (tiêu chuẩn). Bộ chọn Chất lượng AI nằm trên tab Hướng dẫn AI của mỗi Tác nhân. Trang cài đặt Khóa API BYOK hiển thị thông báo bất cứ khi nào khóa của bạn đã được lưu nhưng một hoặc nhiều Tác nhân của bạn vẫn đang chạy trên cấp độ Max, liệt kê các Tác nhân đó — để bạn có thể nhận biết nhanh lý do tại sao tín dụng vẫn đang bị trừ.

Lưu ý về chi phí: Việc tự sử dụng khóa API (BYOK) không còn là lựa chọn tiết kiệm nữa. Khi kết nối khóa của riêng bạn, Agent của bạn sẽ chạy trên Claude và bạn thanh toán trực tiếp theo mức phí đo lường của Anthropic (Anthropic tính phí dựa trên mức sử dụng thực tế của bạn, tương tự như hóa đơn điện nước). Tính trên các tài khoản sử dụng khóa riêng, một phản hồi AI có chi phí cao gấp khoảng 3 lần so với cùng phản hồi đó trên gói Max và hơn 5 lần so với gói Mini, khi tính đến các tác vụ nền mà một phản hồi kích hoạt (tra cứu cơ sở kiến thức, kiểm tra thư rác, trích xuất tên và email, đánh giá cuộc trò chuyện, gắn thẻ). Tất cả các tác vụ này đã được bao gồm trong mức phí cố định của Max và Mini nhưng lại bị tính phí theo token trên khóa của bạn. Các tối ưu hóa bộ nhớ đệm prompt (prompt-caching) của chúng tôi cũng áp dụng cho khóa của bạn, vì vậy đây không phải là vấn đề về bộ nhớ đệm; Max và Mini đơn giản là các mô hình rẻ hơn nhiều và cũng đạt điểm cao hơn trong tiêu chuẩn đánh giá cuộc trò chuyện bán hàng của chúng tôi. Hãy sử dụng BYOK khi bạn muốn việc sử dụng AI được tính phí vào tài khoản Anthropic của riêng bạn, chứ không phải để tiết kiệm tiền.

Tại sao phản hồi đầu tiên trong một cuộc hội thoại lại tốn kém hơn nhiều so với các phản hồi còn lại. Bộ nhớ đệm (caching) hoạt động bằng cách lưu trữ ngữ cảnh của cuộc hội thoại với Anthropic trong lần đầu tiên được gửi, sau đó tái sử dụng nó. Việc ghi dữ liệu tốn kém hơn một yêu cầu thông thường; mỗi phản hồi tái sử dụng nó chỉ tốn khoảng một phần hai mươi chi phí. Vì vậy, phản hồi đầu tiên trông có vẻ đắt đỏ một cách đáng báo động và các phản hồi sau đó lại rất rẻ. Bất kỳ nội dung lớn nào trong cuộc hội thoại đều làm cho phản hồi đầu tiên đó trở nên nặng hơn — một tài liệu mà khách truy cập tải lên là ví dụ chính. Một tệp PDF 24 trang có dung lượng khoảng 70.000 token, vì mỗi trang được gửi dưới dạng cả văn bản và hình ảnh của trang đó, và nó vẫn nằm trong cuộc hội thoại, vì vậy nó được gửi lại (và lưu vào bộ nhớ đệm lại) với mỗi phản hồi. Nếu một cuộc hội thoại im lặng trong hơn một giờ, bản sao được lưu trữ sẽ hết hạn và phản hồi tiếp theo sẽ phải trả phí ghi lại từ đầu.

Nếu bạn đang xây dựng thứ gì đó nặng về tài liệu — trình giải thích hợp đồng, tra cứu hướng dẫn, bất cứ thứ gì mà mọi người tải tệp lên — thì gói Max thường là lựa chọn phù hợp hơn: gói này có mức phí cố định là 0,25 tín dụng cho mỗi phản hồi bất kể tài liệu lớn đến mức nào, vì vậy không có sự tăng vọt chi phí ở tin nhắn đầu tiên và hoàn toàn không có rủi ro về chi phí theo token. Xem Tại sao Max là giá trị tốt nhất để biết cách Max so sánh về chất lượng và chi phí.

Nếu khóa BYOK của bạn bị lỗi (không hợp lệ, hết hạn mức hoặc bị giới hạn tốc độ — nghĩa là Anthropic đã tạm thời giới hạn số lượng yêu cầu mà khóa của bạn có thể thực hiện), việc bot của bạn có tiếp tục chạy hay không phụ thuộc vào nút gạt “Fallback to credits” trên cùng trang BYOK API Keys đó:

  • Bật: nền tảng tạm thời chuyển sang sử dụng tín dụng của nền tảng để bot của bạn tiếp tục trả lời, đồng thời tiếp tục thử lại khóa của bạn trong nền — ngay khi một lệnh gọi thành công trở lại, hệ thống sẽ tự động chuyển bạn về khóa của riêng bạn.
  • Tắt (mặc định): các phản hồi AI sẽ bị chặn cho đến khi bạn sửa khóa. Không có gì tự động sử dụng tín dụng của bạn, nhưng bot của bạn cũng sẽ ngừng trả lời, vì vậy nếu bạn muốn bot tiếp tục hoạt động bằng tín dụng trong khi bạn xử lý vấn đề về khóa, hãy bật nút gạt này trước.

Dù thế nào đi nữa, bạn sẽ nhận được email vào lần đầu tiên khóa của bạn bị lỗi (không phải một email cho mỗi tin nhắn).


Câu hỏi thường gặp

Tôi có thể sử dụng OpenAI, Gemini hoặc nhà cung cấp khác cho BYOK không? Hiện tại thì chưa, đối với các nhà cung cấp khác. Đối với hầu hết mọi người, câu trả lời đã có ở đây: MaxMini là các gói nội bộ của chúng tôi, với mức phí lần lượt là 0,25 và 0,15 tín dụng cho mỗi hành động.

Khóa BYOK của tôi có được sử dụng cho mọi thứ không? Hầu hết các hoạt động AI đều miễn phí tín dụng khi bạn kết nối khóa Anthropic của riêng mình (BYOK): phản hồi AI, sử dụng công cụ, tối ưu hóa chiến dịch, tạo cơ sở kiến thức và tìm kiếm web đều chạy trên khóa của bạn. Bốn thứ vẫn tính phí tín dụng ngay cả khi đã kết nối khóa: gói Max với 0,25 tín dụng mỗi hành động và gói Mini với 0,15, vì cả hai đều chạy trên các mô hình của riêng chúng tôi; Lead Finder với 0,25 cho mỗi địa chỉ email được tìm thấy; và Tự động hóa với 0,25 cho mỗi lần chạy cộng thêm 0,25 cho mỗi bước AI. Để giữ cho một Tác nhân (Agent) hoàn toàn sử dụng khóa của riêng bạn với 0 tín dụng, hãy để nó ở gói Pro. Phí kênh (phí hàng tháng của WhatsApp Web, phí gửi tin nhắn WhatsApp và phí mẫu) được tính riêng biệt với mức sử dụng AI trong mọi trường hợp. Nếu khóa gặp lỗi trong một cuộc gọi lẽ ra phải chạy trên khóa đó, việc nền tảng có tự động chuyển sang sử dụng tín dụng hay không phụ thuộc vào nút gạt Fallback to credits (Chuyển sang tín dụng khi lỗi) của bạn — hãy xem mô tả về nút gạt “Fallback to credits” ở phía trên trang này.

Chính xác thì khi nào các phản hồi AI tốn 0 tín dụng? BYOK được áp dụng theo từng tài khoản. Các phản hồi AI chỉ tốn 0 tín dụng khi tài khoản này đã kết nối khóa Anthropic của riêng mình. Nếu không có khóa riêng, các phản hồi sẽ tiêu tốn tín dụng theo mức phí thông thường.

BYOK có ảnh hưởng đến việc gửi tin nhắn hoặc độ tin cậy của kênh không? Không. BYOK chỉ thay đổi cách tính phí các lệnh gọi AI của bot. Mọi thứ khác — định tuyến tin nhắn, cơ sở hạ tầng kênh, theo dõi, chiến dịch và Broadcasts — đều hoạt động hoàn toàn giống nhau.


Xem thêm: Tại sao Max là giá trị tốt nhất · Thiết lập Bot AI của bạn · Các Tác nhân AI