Công nghệ của Luqira
Luqira tự huấn luyện model avatar và giọng nói, rồi chạy trên hạ tầng suy luận của chính mình, nên độ trễ, chi phí và chất lượng do chúng tôi quyết định.
Chúng tôi không đấu nối AI của người khác. Chúng tôi tự huấn luyện model.
Phần lớn công cụ livestream AI chỉ là lớp vỏ mỏng bọc quanh một API đi thuê. Luqira thì khác: model avatar và model voice là của chính chúng tôi, huấn luyện nội bộ và chạy trên hạ tầng inference của riêng chúng tôi. Nhờ vậy, Luqira trả lời trong chưa đầy một giây, nhân bản giọng nói chỉ từ một mẫu ngắn, và chạy hàng trăm phiên livestream cùng lúc trên cùng một model.
Phản hồi bình luận live, Giọng đọc bản địa hóa, Ngôn ngữ trong thư viện giọng nói, Phiên live đồng thời, cùng một model, Hàng trăm
Hơn 85 ngôn ngữ, một lần train duy nhất.
Ai cũng có thể nói mình tự train model. Đây là những gì thực sự đi vào model của Luqira, kèm mã định danh của từng bộ dữ liệu, để bạn kiểm chứng tận gốc. Hơn 85 ngôn ngữ, train cùng nhau trong một lượt duy nhất — đúng con số 85+ mà thư viện giọng nói đang phục vụ.
Tất cả được train cùng lúc trong một lần chạy, không bao giờ train lần lượt. Train nối tiếp sẽ khiến lượt sau ghi đè lượt trước, đến mức model chỉ còn nói được ngôn ngữ nó thấy gần nhất. Một hỗn hợp dữ liệu, một lần train, một model. Mọi mã bộ dữ liệu ở trên đều là mã chính thức của OpenSLR và đã được đối chiếu với danh mục của OpenSLR chứ không chép theo trí nhớ, nên không có gì phải tin suông. Thư viện giọng nói đầy đủ còn phục vụ nhiều ngôn ngữ hơn nữa.
Mỗi bộ dữ liệu trong hỗn hợp đều được liệt kê đầy đủ trên model card, kèm mã định danh, giấy phép, tần số lấy mẫu và số giờ.
Corpora
Mls
Nguồn giọng nói của cả lần train. Nó không thêm ngôn ngữ mới nào vì model vốn đã nói được cả tám thứ tiếng, nhưng hàng nghìn người đọc khác nhau là thứ dạy một giọng giữ được bản sắc thay vì trôi về mức trung bình.
Multilingual LibriSpeech (SLR94)
Anh, Đức, Hà Lan, Pháp, Ý, Tây Ban Nha, Bồ Đào Nha, Ba Lan
Âm thanh sạch nhất trong hỗn hợp, thu ở 48 kHz trong điều kiện phòng thu chứ không cào từ web. Dung lượng nhỏ, nhưng mỗi giờ đều dạy hẳn một ngôn ngữ mới chứ không chỉ trau chuốt thứ đã biết.
TTS phòng thu của Google (SLR37, 41-44)
Bengal, Java, Khmer, Nepal, Sunda
Google Indic
Khối dạy ngôn ngữ lớn nhất trong hỗn hợp: sáu ngôn ngữ Ấn Độ cộng tiếng Miến Điện, thu theo cùng chuẩn phòng thu. Là bảy mã riêng lẻ chứ không phải dải liền SLR63-80 như vẫn hay được viết, và trong đó không có tiếng Hindi lẫn Punjab — cả hai đến với model qua FLEURS.
Dữ liệu cộng đồng của Google (SLR63-66, 78-80)
Malayalam, Marathi, Tamil, Telugu, Gujarati, Kannada, Miến Điện
Bible
Giá trị trên mỗi giờ cao nhất trong toàn bộ hỗn hợp. Tiếng Twi gần như xa lạ với model trước đó, và đây là dữ liệu đạt chuẩn sách nói cho những ngôn ngữ Tây và Trung Phi mà hầu hết engine không đụng tới. Năm trong sáu ngôn ngữ đã căn chỉnh của bộ này được dùng, trừ tiếng Ewe.
BibleTTS (SLR129)
Twi (Asante và Akuapem), Hausa, Lingala, Yoruba
Aishell
Một lượt tinh chỉnh giọng cho tiếng Quan Thoại, không phải dạy ngôn ngữ. Model vốn đã thành thạo, nên 400 người nói thu sạch chỉ thay đổi cách nó nghe ra sao, không phải nó biết gì.
AISHELL-1 (SLR33)
Tiếng Quan Thoại
Yoruba
Bộ dữ liệu nhỏ nhất ở đây, và là lượt thứ hai cho một ngôn ngữ mà BibleTTS đã dạy. Bốn mươi giờ tiếng Yoruba thu sạch trong phòng thu từ một nhóm người nói khác là thứ ngăn một bộ dữ liệu duy nhất quyết định cả một ngôn ngữ nghe ra sao.
TTS đa giọng tiếng Yoruba (SLR86)
Yoruba
Fleurs
Lớp phủ bề rộng. Khoảng mười giờ dữ liệu đọc song song cho mỗi ngôn ngữ, và là lý do lần train này vượt mốc tám mươi lăm ngôn ngữ thay vì dừng ở hai mươi lăm ngôn ngữ mà các bộ OpenSLR cộng lại mới có. Tiếng Hindi và Punjab đến từ đây chứ không phải từ các khối phòng thu.
Google FLEURS
102 ngôn ngữ, bao trùm và mở rộng tất cả những bộ trên
Chúng tôi tự train trên OmniVoice. Trọng số là của chúng tôi.
Luqira Voices do chính chúng tôi train trên OmniVoice, một kiến trúc giọng nói dựa trên audio codebook được xây trên model ngôn ngữ Qwen3-0.6B. Cả hai đều là Apache-2.0, và chúng tôi nói thẳng điều đó thay vì để người đọc hiểu nhầm rằng chúng tôi tự nghĩ ra kiến trúc. Thứ chúng tôi train là chính model: tham số khởi tạo ngẫu nhiên trên kiến trúc đó, nên không kế thừa trọng số của bất kỳ bên thứ ba nào. Chúng tôi chọn bộ dữ liệu, dựng hỗn hợp, chạy quá trình train, và sở hữu bộ trọng số mình đã train, với đầy đủ quyền khai thác thương mại và không phải thương lượng giấy phép với bất kỳ ai, trong khi Qwen và k2-fsa vẫn giữ bản quyền với phần việc của họ. Chúng tôi không thuê model của nhà cung cấp nào. Chúng chạy trên GPU của chính chúng tôi và không bao giờ đi qua API bên thứ ba.
Trọng số của chúng tôi
Model card công khai, kiểm chứng được ngoài tên miền của chúng tôi: huggingface.co/GuidenAI/genpio_voice
bộ dữ liệu công khai, giờ gộp lại, ngôn ngữ, lần train
Tất cả, Dạy ngôn ngữ mới, Bổ sung giọng nói, Tinh chỉnh chất giọng, Mở rộng bề ngang
đã cắt bớt
Độ dài thanh theo thang logarit. Con số là số giờ thô có sẵn, trước khi áp trần theo từng ngôn ngữ.
Kích thước bộ dữ liệu không phải là tỷ trọng khi train. Multilingual LibriSpeech mang lại lượng audio gấp khoảng 1.250 lần bộ dữ liệu nhỏ nhất trong hỗn hợp, và mức trần theo từng ngôn ngữ san phẳng khoảng cách đó một cách có chủ đích, để những ngôn ngữ thực sự đang được dạy không bao giờ bị lấn át bởi những ngôn ngữ vốn đã trôi chảy.
Model của chúng tôi được xây dựng và cấp phép ra sao
Có, và chúng tôi nói rõ điều đó nghĩa là gì. Luqira Voices được train nội bộ từ khởi tạo ngẫu nhiên trên kiến trúc OmniVoice (Apache-2.0), vốn được xây trên Qwen3-0.6B. Đây không phải bản fine-tune từ checkpoint của bất kỳ ai: không kế thừa trọng số model của bên thứ ba nào, và model card đã công bố mang nhãn trained-from-scratch. Chúng tôi chọn bộ dữ liệu huấn luyện (OpenSLR SLR94, SLR37, SLR41-44, SLR63-66, SLR78-80, SLR86, SLR129, SLR33 và Google FLEURS, hơn 60 ngôn ngữ trong một lượt train), dựng hỗn hợp và chạy huấn luyện. Nói cho chính xác, vì cả hai vế đều kiểm chứng được: chúng tôi sở hữu bộ trọng số mình đã train và có mọi quyền dùng nó vào mục đích thương mại, dưới một giấy phép Apache-2.0 vĩnh viễn trên kiến trúc gốc, không giới hạn lĩnh vực sử dụng, không trần doanh thu và không có giấy phép nào phải đàm phán lại với ai; còn Qwen và k2-fsa vẫn giữ bản quyền với phần việc của họ. Chúng tôi không thuê model của nhà cung cấp nào và không bán lại text-to-speech của bên thứ ba. Mọi thứ chạy trên hạ tầng inference của chính chúng tôi, không có API bên thứ ba nào trong đường phục vụ, và đó là lý do chúng tôi giữ được latency, chi phí và chất lượng ở mức một bên bán lại không thể. Model card công khai tại huggingface.co/GuidenAI/genpio_voice, nên không điều nào ở trên phải tin vào lời chúng tôi.
AI đi thuê luôn có trần. AI của chúng tôi thì không.
Bạn đã thấy thành phần dữ liệu và giấy phép. Còn đây là những gì việc sở hữu bộ trọng số thay đổi, từng dòng một, so với một công cụ đi thuê lại đúng năng lực đó từ người khác.
Công cụ vỏ bọc
Luqira
Rows
Cost
Trả tiền cho nhà cung cấp theo từng phút, thêm một phiên live là hóa đơn lại dày thêm
Chúng tôi tự chủ phần inference, nên thêm phiên live không có nghĩa là chi phí nhân lên
Latency
Latency ra sao là do nhà cung cấp quyết định, ngày nào biết ngày đó
Chúng tôi tự tinh chỉnh latency, tới từng khung hình
Quality
Một lỗi chất lượng đồng nghĩa với một ticket hỗ trợ và một quãng chờ dài
Một lỗi chất lượng là thứ chúng tôi sửa thẳng trong model
Scale
Mỗi lần một phiên, chỉ cần chạm rate limit là tắt sóng
Thêm phiên live thứ một trăm mà không phải xin phép ai: GPU là của chúng tôi
Do chúng tôi tự dựng, nên nó uốn theo bạn
Gương mặt của bạn, dựng ngay khi đang live.
Nhân bản chính bạn hoặc bắt đầu từ một host mang thương hiệu. Khẩu hình được tạo ra từng khung hình một, không phải ghép lại từ các đoạn clip, nên miệng bám theo lời nói thay vì chạy đuổi phía sau.
Giọng của bạn, chỉ từ một mẫu ngắn.
Giọng nhân bản giữ nguyên nhịp nói và sự ấm áp của bạn. Với hơn 600 giọng bản địa, nó đọc một mức giá, một cái tên hay một câu chốt đúng như người bản xứ, chứ không phải như một bản dịch đọc to.
Thuộc lòng catalog của bạn.
Import sản phẩm, giá, FAQ và các điểm bán hàng. Host trả lời chính xác và bám đúng thông điệp, kể cả khi người xem hỏi dồn.
Mọi nền tảng, cùng một lúc.
TikTok, YouTube, Shopee, Instagram và nhiều nữa, lên sóng song song từ một workspace duy nhất.
Một bình luận thành một đơn hàng trong chưa đầy một giây
Bốn bước, một vòng lặp, chạy liên tục chừng nào phiên live còn lên sóng.
dưới 1 giây, từ đầu đến cuối
Chính câu trả lời làm nảy sinh bình luận tiếp theo, nên vòng lặp lại bắt đầu.
Lắng nghe
Bình luận, câu hỏi và phản ứng đổ về cùng lúc từ mọi nền tảng đã kết nối.
Thấu hiểu
Ý định, cảm xúc và tín hiệu mua hàng được đối chiếu với catalog, bảng giá và giọng thương hiệu của bạn.
Cất lời
Model voice của chúng tôi trả lời bằng chính giọng đã nhân bản của bạn, đúng ngôn ngữ mà người xem đang gõ.
Lên hình
Model avatar của chúng tôi dựng câu trả lời với khẩu hình khớp từng khung hình rồi đẩy thẳng lên sóng.
Nhờ trợ lý AI thiết lập buổi livestream cho bạn.
Luqira hỗ trợ MCP, giao thức mà các ứng dụng AI dùng để kết nối tới công cụ bên ngoài. Kết nối một lần là trợ lý có thể mở tài khoản, chọn gói phù hợp, viết kịch bản và thêm sản phẩm vào thư viện, để buổi livestream đầu tiên bắt đầu bằng một cuộc trò chuyện thay vì cả buổi chiều cài đặt.
- Trỏ ứng dụng AI tới Luqira — Một endpoint duy nhất, không cần tạo API key. Dán vào ChatGPT, Claude, Codex hay ứng dụng bạn đang dùng.
- Duyệt ngay trên trình duyệt của bạn — Trợ lý đưa bạn một đường link và một mã ngắn. Bạn đăng nhập trên trang của Luqira rồi bấm duyệt. Trợ lý không bao giờ thấy mật khẩu.
- Yêu cầu những gì bạn cần — Tài khoản, gói phù hợp, kịch bản cho tối nay, sản phẩm lấy thẳng từ link cửa hàng. Trợ lý lo phần cài đặt trong lúc bạn trò chuyện.
Chat
Ứng dụng MCP bất kỳ
Thiết lập Luqira cho tối nay và thêm ba sản phẩm này.
Bạn mở link này và duyệt mã 4F2C-91KD, phần còn lại để tôi lo.
- Đã kết nối tài khoản
- Đã chọn gói, link thanh toán sẵn sàng
- Đã viết và lưu kịch bản mở màn
- Đã nhập 3 sản phẩm từ link của bạn
| title | desc |
|---|---|
| Không bao giờ thấy mật khẩu của bạn | Việc đăng nhập diễn ra trên trang của Luqira, ngay trong trình duyệt của bạn. |
| Không giữ thông tin đăng nhập | Kết nối chỉ trả về một mã định danh, ra khỏi Luqira là vô nghĩa. |
| Không tự trừ tiền thẻ | Trợ lý chỉ đưa bạn link thanh toán. Bạn tự hoàn tất trên trang thanh toán bảo mật. |
Hạ tầng bạn có thể tin cậy
Bảo mật chuẩn doanh nghiệp
TLS 1.3 khi truyền, AES-256 khi lưu, và nhân bản giọng nói không chạy nếu chính chủ giọng chưa đồng ý. Toàn bộ biện pháp kiểm soát được liệt kê trên trang bảo mật.
Đọc trang bảo mật
SLA uptime 99.9%
Một con số cam kết trên hạ tầng đa vùng có tự động chuyển dự phòng, không phải một mong muốn. Mạng lưới edge toàn cầu giữ latency thấp đúng lúc doanh thu phụ thuộc vào phiên live.
API mở và tích hợp
Đấu nối Luqira vào CRM, OMS, analytics và gian hàng của bạn. Tài liệu API là công khai, đọc không cần key.
Đọc tài liệu API
Hỗ trợ chuyên trách
Ưu tiên onboarding, đào tạo và một đội phụ trách tài khoản cùng bạn chịu trách nhiệm về kết quả.