Luqira

Luqira 技术

Luqira 自己训练数字人模型和语音模型,并跑在自有推理栈上,因此延迟、成本和质量由我们自己调优,而不是等供应商。

我们没有套用 别人的 AI, 模型是我们自己训的。

多数 AI 直播工具,只是在租来的第三方 API 外面套了一层壳。Luqira 的数字人模型和语音模型是我们自研的,自己训练,跑在自己的推理架构上。所以我们能做到一秒内应答,用一小段样音就克隆出声音,还能用同一个模型同时跑数百场直播。

对实时评论的反应, 本地化母语人声, 语音库覆盖的语言, 并发直播,同一个模型, 数百

超过 85 种语言,一次训练完成。

谁都可以说自己训练了模型。以下是真正进入 Luqira 模型的数据,并附上每个语料库的编号,方便你回到源头核实。85 种以上的语言,在一次训练中一起训练完成——和线上语音库支持的 85+ 是同一个数字。

所有数据在同一轮训练中一起学习,绝不逐个训练。逐个训练会让后一轮覆盖前一轮,最终模型只会说它最后见到的那一种。一份混合语料,一轮训练,一个模型。上面每一个语料库编号都是 OpenSLR 的官方编号,并且是对照 OpenSLR 索引核对过的,而不是凭记忆写下的,无需凭空相信。完整语音库覆盖的语言还要更多。

这套混合数据里的每一个语料库都在模型卡上有完整记录,包含编号、许可证、采样率和时长。

Corpora

Mls

这一轮训练的声音来源。它没有新增任何语言,因为模型本就会说这八种,但数千位不同的朗读者正是让一个声音保持个性、而不是滑向平均值的关键。

Multilingual LibriSpeech(SLR94)

英语、德语、荷兰语、法语、意大利语、西班牙语、葡萄牙语、波兰语

Google

整个混合语料中最干净的音频,以 48 kHz 录制于录音棚环境而非从网络抓取。体量不大,但它的每一小时都在从零教会一门新语言,而不是打磨模型已经掌握的语言。

Google 录音棚 TTS(SLR37、41-44)

孟加拉语、爪哇语、高棉语、尼泊尔语、巽他语

Google Indic

混合语料中真正教语言的最大一块:六种印度语言加缅甸语,按同一录音棚标准录制。它是七个独立编号,而不是常被写成的连续区间 SLR63-80,其中既没有印地语也没有旁遮普语——这两种语言是通过 FLEURS 进入模型的。

Google 众包录音(SLR63-66、78-80)

马拉雅拉姆语、马拉地语、泰米尔语、泰卢固语、古吉拉特语、卡纳达语、缅甸语

Bible

整个混合语料中每小时价值最高的一份。此前模型对契维语几乎一无所知,而这份数据以有声书级的保真度覆盖了大多数引擎从不触碰的西非与中非语言。已对齐的六种语言中用了五种,仅埃维语除外。

BibleTTS(SLR129)

契维语(阿桑特与阿夸佩姆)、豪萨语、林加拉语、约鲁巴语

Aishell

这是对普通话的音色打磨,而非语言教学。模型本就流利,400 位说话人的纯净室内录音改变的是它听起来如何,而不是它懂得什么。

AISHELL-1(SLR33)

普通话

Yoruba

这里最小的一份语料,也是对 BibleTTS 已经教过的语言的第二次录制。来自另一组说话人的四十小时录音棚级约鲁巴语,正是它让一份语料无法独自决定整门语言听起来是什么样子。

约鲁巴语多说话人 TTS(SLR86)

约鲁巴语

Fleurs

负责广度的一层。每种语言约十小时的平行朗读语音,也正是它让这一轮训练突破八十五种语言,而不是停在 OpenSLR 语料合起来的二十五种。印地语和旁遮普语也从这里进入,而非来自录音棚语料。

Google FLEURS

102 种语言,覆盖并扩展了上述全部

在 OmniVoice 架构上自主训练,权重归我们所有。

Luqira Voices 由我们自己在 OmniVoice 架构上训练。OmniVoice 是一种基于音频码本的语音架构,构建在 Qwen3-0.6B 语言模型之上。两者均为 Apache-2.0 许可,我们直接说明这一点,而不是暗示架构由我们发明。我们训练的是模型本身:参数在该架构上从随机初始化开始训练,没有继承任何第三方的模型权重。语料由我们挑选,混合方案由我们设计,训练由我们执行,我们训练出的权重归我们所有,拥有全部商业使用权,无需与任何一方重新谈判授权;同时 Qwen 和 k2-fsa 保留他们自己成果的著作权。我们不向任何供应商租用模型。它们跑在我们自己的 GPU 上,绝不经过任何第三方 API。

权重归我们所有

公开的模型卡,可在我们自己域名之外核对:huggingface.co/GuidenAI/genpio_voice

个公开语料库, 小时汇总, 种语言, 轮训练

全部, 教会新语言, 补充说话人, 音色打磨, 拓展广度

已截取

条形长度为对数刻度。数字为可用原始时长,尚未应用按语言的上限。

语料规模不等于训练占比。Multilingual LibriSpeech 的音频量约为混合语料中最小一份的 1,250 倍,而按语言设定的上限刻意抹平了这一差距,好让真正需要被教会的语言不会被本就流利的语言淹没。

我们的模型如何构建与授权

是的,而且我们会把话说具体。Luqira Voices 是在 Apache-2.0 的 OmniVoice 架构(其本身构建在 Qwen3-0.6B 之上)上,从随机初始化开始自研训练出来的。它不是任何人检查点的微调:没有继承任何第三方模型权重,公开的模型卡也带着 trained-from-scratch 标签。训练语料由我们自己挑选(OpenSLR SLR94、SLR37、SLR41-44、SLR63-66、SLR78-80、SLR86、SLR129、SLR33 以及 Google FLEURS,60 种以上的语言在一次训练中完成),配比由我们自己设计,训练也由我们自己跑。说得精确一点,因为两边都可以核实:我们拥有自己训练出来的权重,并在对上游架构的永久 Apache-2.0 授权之下,享有全部商用权利,没有使用领域限制、没有收入上限、也没有需要跟谁重新谈的许可;同时 Qwen 和 k2-fsa 保留他们自己成果的著作权。我们不向任何供应商租用模型,也不转售第三方的语音合成。一切都跑在我们自己的推理栈上,服务链路里没有任何第三方 API——这正是我们能把延迟、成本和质量攥在手里,而转售商做不到的原因。模型卡公开在 huggingface.co/GuidenAI/genpio_voice,以上没有一条需要你只听我们的说法。

租来的 AI 有天花板,我们的没有。

训练数据的构成和许可证都在上面。接下来是拥有模型权重会带来什么不同——逐行对比那些把同样能力从别人那里租来用的工具。

套壳工具

Luqira

Rows

Cost

按分钟付费给供应商,每多开一场直播,账单就多一截

推理是我们自己的,多开直播不会让成本成倍上涨

Latency

延迟是多少,全看供应商当天给你什么

延迟由我们自己调,精细到每一帧

Quality

效果出了问题,只能提工单,然后慢慢等

效果出了问题,我们直接在模型里改

Scale

一次只能开一场,离触发限流、直播中断只有一步之遥

第一百场并发直播,不用向谁申请——GPU 是我们自己的

自己训的模型,才能按你的需求改

你的形象,实时生成。

克隆你本人的样貌,也可以直接用品牌主播。口型逐帧生成,不是拿片段拼接,所以嘴型跟着话走,而不是追着话跑。

一小段样音,还原你的声音。

克隆出的声音保留你的语速和温度。600 多个本地化声线,念价格、念名字、抖包袱都像母语者在说,而不是把译文念出来。

对你的商品库了如指掌。

导入商品、价格、常见问题和卖点。主播回答准确、不跑题,观众追问也稳得住。

所有平台,同时开播。

TikTok、YouTube、Shopee、Instagram 等平台,在一个工作台里并行直播。

一条评论,一秒内变成一笔成交

四个环节,一个闭环,直播不停,它就一直转。

端到端,1 秒以内

这个回答本身就会引出下一条评论,循环于是重新开始。

聆听

评论、提问和互动,从每一个已连接的平台同时汇入。

理解

对照你的商品库、你的价格和你的品牌口吻,读出意图、情绪和购买信号。

发声

语音模型用克隆出的你的声音作答,而且用观众正在打字的那门语言。

呈现

数字人模型逐帧生成对上口型的画面,并直接推流上线。

让 AI 助手帮你完成直播设置。

Luqira 支持 MCP,也就是 AI 客户端连接外部工具所用的协议。连接一次,助手就能开通账号、匹配套餐、撰写话术并填充商品库,第一场直播从一次对话开始,而不是一下午的配置。

numtitledesc
01把客户端指向 Luqira一个地址,无需申请 API key。粘贴到 ChatGPT、Claude、Codex 或你正在用的客户端里。
02在浏览器里确认授权助手会给你一个链接和一个短码。你在 Luqira 自己的页面登录并确认,助手始终看不到你的密码。
03直接开口提要求开通账号、选定套餐、今晚的话术,或者直接从商品链接导入商品。你说话,它把设置做完。

Chat

任意 MCP 客户端

帮我把今晚的 Luqira 直播设置好,再加这三款商品。

请打开这个链接并确认验证码 4F2C-91KD,剩下的交给我。

  • 账号已连接
  • 套餐已选定,支付链接已就绪
  • 开场话术已写好并保存
  • 已从你的链接导入 3 款商品
titledesc
始终看不到你的密码登录在 Luqira 自己的页面完成,就在你的浏览器里。
不保存你的登录凭据连接只会返回一个句柄,离开 Luqira 就毫无用处。
不会扣你的卡它只能给你一个支付链接,付款由你在安全支付页面上自行完成。

靠得住的底层设施

企业级安全

传输用 TLS 1.3,存储用 AES-256,声音克隆没有本人授权就不会运行。全部控制措施都列在我们的安全页面上。

查看安全页面

99.9% 在线率 SLA

这是建立在多区域部署和自动故障切换之上的承诺值,不是愿望。全球边缘节点分发,在收入压在直播上的时候把延迟压低。

开放 API 与集成

把 Luqira 接进你的 CRM、OMS、分析和门店系统。API 文档公开,不需要密钥就能查阅。

查看 API 文档

专属支持

优先入驻、专业培训,还有一支和你一起对结果负责的客户团队。