เทคโนโลยีของ Luqira
Luqira ฝึกโมเดลอวตารและโมเดลเสียงขึ้นเอง และให้บริการบน inference stack ของตัวเอง ความหน่วง ต้นทุน และคุณภาพจึงเป็นสิ่งที่เราปรับจูนเอง
เราไม่ได้แค่เรียก API ของ AI คนอื่น เราเทรนโมเดลเอง
เครื่องมือไลฟ์ AI ส่วนใหญ่เป็นแค่เปลือกบาง ๆ ที่ครอบ API ซึ่งไปเช่าคนอื่นมาอีกที ส่วนโมเดลอวาตารและโมเดลเสียงของ Luqira เป็นของเราเอง เทรนเองในทีม และให้บริการบน inference stack ของเราเอง นั่นคือเหตุผลที่เราตอบได้ในเวลาไม่ถึงวินาที โคลนเสียงจากตัวอย่างสั้น ๆ และรันไลฟ์หลายร้อยสตรีมพร้อมกันได้จากโมเดลเดียวกัน
ตอบสนองคอมเมนต์สด, เสียงเจ้าของภาษาที่โลคัลไลซ์แล้ว, ภาษาในคลังเสียง, สตรีมพร้อมกัน จากโมเดลเดียว, หลักร้อย
มากกว่า 85 ภาษา ในการเทรนรอบเดียว
ใครก็พูดได้ว่าเทรนโมเดลเอง นี่คือสิ่งที่เข้าไปในโมเดลของ Luqira จริง ๆ พร้อมรหัสของแต่ละคลังข้อมูล เพื่อให้ตรวจสอบย้อนไปถึงต้นทางได้ มากกว่า 85 ภาษา ฝึกไปด้วยกันในรอบเดียว เป็นตัวเลขเดียวกับ 85+ ที่คลังเสียงให้บริการจริง
ทุกอย่างเทรนไปพร้อมกันในรอบเดียว ไม่ใช่ไล่ทีละภาษา เพราะการเทรนต่อกันจะทำให้รอบหลังทับรอบก่อน จนโมเดลพูดได้เฉพาะภาษาที่เห็นล่าสุด ข้อมูลผสมชุดเดียว เทรนรอบเดียว ได้โมเดลเดียว รหัสคลังข้อมูลทุกตัวข้างต้นเป็นรหัสทางการของ OpenSLR และตรวจทานกับดัชนีของ OpenSLR แทนที่จะอ้างจากความจำ จึงไม่ต้องเชื่อแบบไร้ที่มา คลังเสียงเต็มยังครอบคลุมภาษามากกว่านี้อีก
ทุกคลังข้อมูลในส่วนผสมนี้มีรายละเอียดครบอยู่ในโมเดลการ์ด ทั้งรหัส สัญญาอนุญาต อัตราสุ่มตัวอย่าง และจำนวนชั่วโมง
Corpora
Mls
แหล่งเสียงของการเทรนรอบนี้ ไม่ได้เพิ่มภาษาใหม่เลยเพราะโมเดลพูดได้ทั้งแปดภาษาอยู่แล้ว แต่ความหลากหลายของผู้อ่านนับพันคนคือสิ่งที่สอนให้เสียงคงเอกลักษณ์ไว้แทนที่จะเลื่อนไปหาค่าเฉลี่ย
Multilingual LibriSpeech (SLR94)
อังกฤษ เยอรมัน ดัตช์ ฝรั่งเศส อิตาลี สเปน โปรตุเกส โปแลนด์
เสียงที่สะอาดที่สุดในชุดผสม บันทึกที่ 48 kHz ในสตูดิโอไม่ใช่ดึงมาจากเว็บ ขนาดเล็กแต่ทุกชั่วโมงสอนภาษาขึ้นใหม่ทั้งภาษา ไม่ใช่แค่ขัดเกลาภาษาที่รู้อยู่แล้ว
TTS สตูดิโอของ Google (SLR37, 41-44)
เบงกาลี ชวา เขมร เนปาล ซุนดา
Google Indic
บล็อกที่สอนภาษาใหม่ได้มากที่สุดในชุดผสม หกภาษาอินเดียบวกภาษาพม่า บันทึกด้วยมาตรฐานสตูดิโอเดียวกัน เป็นเจ็ดรหัสแยกกัน ไม่ใช่ช่วงต่อเนื่อง SLR63-80 อย่างที่มักเขียนกัน และไม่มีทั้งภาษาฮินดีและปัญจาบ ทั้งสองภาษาเข้าสู่โมเดลผ่าน FLEURS แทน
เสียงจากอาสาสมัครของ Google (SLR63-66, 78-80)
มลยาฬัม มราฐี ทมิฬ เตลูกู คุชราต กันนาดา พม่า
Bible
คุ้มค่าต่อชั่วโมงมากที่สุดในชุดผสมทั้งหมด ก่อนหน้านี้โมเดลแทบไม่รู้จักภาษาทวีเลย และชุดนี้ให้ความคมชัดระดับหนังสือเสียงกับภาษาแอฟริกาตะวันตกและแอฟริกากลางที่เอนจินส่วนใหญ่ไม่เคยแตะ ใช้ห้าจากหกภาษาที่จัดเรียงไว้ ยกเว้นภาษาเอเว
BibleTTS (SLR129)
ทวี (อาซันเตและอากัวเปม) เฮาซา ลิงกาลา โยรูบา
Aishell
เป็นการปรับน้ำเสียงภาษาจีนกลาง ไม่ใช่การสอนภาษา โมเดลพูดคล่องอยู่แล้ว เสียงบันทึกในร่มที่สะอาดจากผู้พูด 400 คนจึงเปลี่ยนว่ามันฟังดูอย่างไร ไม่ใช่ว่ามันรู้อะไร
AISHELL-1 (SLR33)
จีนกลาง
Yoruba
คลังข้อมูลที่เล็กที่สุดในที่นี้ และเป็นรอบที่สองของภาษาที่ BibleTTS สอนไปแล้ว เสียงโยรูบาสี่สิบชั่วโมงที่บันทึกในสตูดิโอจากผู้พูดอีกกลุ่มหนึ่งคือสิ่งที่กันไม่ให้คลังข้อมูลเดียวเป็นผู้กำหนดว่าทั้งภาษาต้องฟังดูอย่างไร
TTS หลายผู้พูดภาษาโยรูบา (SLR86)
โยรูบา
Fleurs
ชั้นที่ให้ความกว้าง เสียงอ่านคู่ขนานราวสิบชั่วโมงต่อภาษา และเป็นเหตุผลที่การเทรนรอบนี้ทะลุแปดสิบห้าภาษา แทนที่จะหยุดอยู่ที่ยี่สิบห้าภาษาซึ่งคลังข้อมูล OpenSLR รวมกันครอบคลุมได้ ภาษาฮินดีและปัญจาบก็มาจากตรงนี้ ไม่ใช่จากบล็อกสตูดิโอ
Google FLEURS
102 ภาษา ครอบคลุมและขยายจากทั้งหมดข้างต้น
เราเทรนเองบน OmniVoice น้ำหนักโมเดลเป็นของเรา
Luqira Voices คือโมเดลที่เราเทรนเองบน OmniVoice ซึ่งเป็นสถาปัตยกรรมเสียงแบบ audio codebook ที่สร้างอยู่บนโมเดลภาษา Qwen3-0.6B ทั้งสองอย่างเป็น Apache-2.0 และเราบอกตรง ๆ แทนที่จะทำให้เข้าใจว่าเราคิดค้นสถาปัตยกรรมนี้เอง สิ่งที่เราเทรนคือตัวโมเดลเอง พารามิเตอร์เริ่มจากการสุ่มค่าตั้งต้นบนสถาปัตยกรรมนั้น จึงไม่ได้รับช่วงน้ำหนักโมเดลจากบุคคลที่สามใด ๆ เราเลือกคลังข้อมูลเอง ออกแบบชุดผสมเอง รันการเทรนเอง และเป็นเจ้าของน้ำหนักโมเดลที่เราเทรนเอง มีสิทธิ์ใช้เชิงพาณิชย์ครบถ้วนและไม่มีไลเซนส์ใดต้องไปเจรจากับใคร ขณะที่ Qwen และ k2-fsa ยังคงถือลิขสิทธิ์ในงานของตนเอง และเราไม่ได้เช่าโมเดลจากผู้ให้บริการรายใด น้ำหนักโมเดลรันบน GPU ของเราเองและไม่เคยส่งผ่าน API ของบุคคลที่สาม
น้ำหนักของเรา
โมเดลการ์ดสาธารณะ ตรวจสอบได้นอกโดเมนของเราเอง: huggingface.co/GuidenAI/genpio_voice
คลังข้อมูลสาธารณะ, ชั่วโมงรวมกัน, ภาษา, รอบการเทรน
ทั้งหมด, สอนภาษาใหม่, เพิ่มผู้พูด, ปรับคุณภาพเสียง, เพิ่มความกว้าง
ถูกจำกัด
ความยาวแท่งเป็นสเกลลอการิทึม ตัวเลขคือชั่วโมงดิบที่มีอยู่ ก่อนใช้เพดานรายภาษา
ขนาดคลังข้อมูลไม่ใช่สัดส่วนในการเทรน Multilingual LibriSpeech มีเสียงมากกว่าคลังข้อมูลที่เล็กที่สุดในชุดผสมราว 1,250 เท่า และเพดานรายภาษาจงใจกดความต่างนั้นให้ราบลง เพื่อไม่ให้ภาษาที่กำลังถูกสอนจริง ๆ ถูกกลบด้วยภาษาที่คล่องอยู่แล้ว
โมเดลของเราสร้างขึ้นและให้สิทธิ์อย่างไร
ใช่ และเราจะบอกให้ชัดว่าหมายถึงอะไร Luqira Voices เทรนเองภายในบริษัทจากการสุ่มค่าเริ่มต้น บนสถาปัตยกรรม OmniVoice ที่เป็น Apache-2.0 ซึ่งสร้างอยู่บน Qwen3-0.6B อีกที ไม่ใช่การ fine-tune จาก checkpoint ของใคร ไม่มีการรับช่วง weights ของโมเดลจากบุคคลที่สาม และโมเดลการ์ดที่เผยแพร่ติดแท็ก trained-from-scratch เราเป็นคนเลือกคลังข้อมูลสำหรับเทรนเอง (OpenSLR SLR94, SLR37, SLR41-44, SLR63-66, SLR78-80, SLR86, SLR129, SLR33 และ Google FLEURS มากกว่า 60 ภาษาในการเทรนรอบเดียว) จัดส่วนผสมเอง และรันการเทรนเอง พูดให้ตรงเพราะตรวจสอบได้ทั้งสองด้าน เราเป็นเจ้าของ weights ที่เราเทรน และมีสิทธิ์ใช้เชิงพาณิชย์ได้ทุกประการ ภายใต้สิทธิ Apache-2.0 แบบถาวรเหนือสถาปัตยกรรมต้นทาง โดยไม่มีข้อจำกัดด้านการใช้งาน ไม่มีเพดานรายได้ และไม่มีสัญญาอนุญาตที่ต้องไปเจรจาใหม่กับใคร ขณะที่ Qwen และ k2-fsa ยังคงถือลิขสิทธิ์ในงานของตนเอง เราไม่ได้เช่าโมเดลจากผู้ให้บริการรายใด และไม่ได้ขายต่อระบบสังเคราะห์เสียงของบุคคลที่สาม ทุกอย่างรันบนระบบ inference ของเราเอง ไม่มี API ของบุคคลที่สามอยู่ในเส้นทางให้บริการ นั่นคือเหตุผลที่เราคุม latency ต้นทุน และคุณภาพได้ในแบบที่ผู้ขายต่อทำไม่ได้ โมเดลการ์ดเปิดสาธารณะที่ huggingface.co/GuidenAI/genpio_voice ทั้งหมดนี้จึงไม่ต้องเชื่อเราเพียงคำพูด
AI ที่เช่ามามีเพดาน ของเราไม่มี
คุณได้เห็นส่วนผสมของข้อมูลและสัญญาอนุญาตไปแล้ว ต่อจากนี้คือสิ่งที่การเป็นเจ้าของ weights เปลี่ยนไป ทีละบรรทัด เทียบกับเครื่องมือที่เช่าความสามารถเดียวกันมาจากคนอื่น
เครื่องมือที่ครอบ API คนอื่น
Luqira
Rows
Cost
จ่ายเจ้าของ API เป็นรายนาที ยิ่งไลฟ์มาก บิลยิ่งบาน
เราเป็นเจ้าของ inference เอง เพิ่มสตรีมแล้วต้นทุนไม่พุ่งตาม
Latency
latency ได้เท่าที่เจ้าของ API ให้มาในวันนั้น
เราจูน latency เอง ละเอียดถึงระดับเฟรม
Quality
เจอปัญหาคุณภาพ ทำได้แค่เปิด support ticket แล้วรอ
เจอปัญหาคุณภาพ เราแก้ที่ตัวโมเดลได้เลย
Scale
ไลฟ์ได้ทีละสตรีม และดับได้ทุกเมื่อเมื่อชน rate limit
เพิ่มสตรีมที่ร้อยพร้อมกันได้โดยไม่ต้องขออนุญาตใคร เพราะ GPU เป็นของเราเอง
เราสร้างเอง มันจึงปรับให้เข้ากับคุณได้
หน้าของคุณ เรนเดอร์สดแบบเรียลไทม์
โคลนหน้าตาของคุณ หรือเริ่มจากโฮสต์ที่ออกแบบตามแบรนด์ก็ได้ ลิปซิงก์ถูกสร้างขึ้นทีละเฟรม ไม่ใช่การตัดคลิปมาต่อกัน ปากจึงขยับตามคำพูด ไม่ใช่วิ่งไล่ตามคำพูด
เสียงของคุณ จากตัวอย่างสั้น ๆ
เสียงที่โคลนแล้วยังคงจังหวะการพูดและความอบอุ่นแบบคุณ ด้วยเสียงเจ้าถิ่นกว่า 600 เสียง มันอ่านราคา ชื่อสินค้า และมุกตลกได้อย่างเจ้าของภาษา ไม่ใช่เสียงอ่านคำแปล
รู้จักสินค้าของคุณทุกซอกทุกมุม
นำเข้าสินค้า ราคา คำถามที่พบบ่อย และจุดขาย โฮสต์จะตอบได้ตรงและอยู่ในสารของแบรนด์เสมอ แม้ผู้ชมจะถามจี้
ทุกแพลตฟอร์ม พร้อมกัน
TikTok, YouTube, Shopee, Instagram และอื่น ๆ ไลฟ์พร้อมกันได้จากเวิร์กสเปซเดียว
จากคอมเมนต์สู่การปิดการขาย ในเวลาไม่ถึงวินาที
สี่ขั้นตอน วนเป็นลูปเดียว ทำงานต่อเนื่องตราบใดที่ไลฟ์ยังไม่ปิด
ไม่ถึง 1 วินาที ตั้งแต่ต้นจนจบ
คำตอบนั้นเองที่ทำให้เกิดคอมเมนต์ถัดไป ลูปจึงเริ่มรอบใหม่
ฟัง
คอมเมนต์ คำถาม และรีแอคชันจากทุกแพลตฟอร์มที่เชื่อมต่อไว้ ไหลเข้ามาพร้อมกัน
เข้าใจ
โมเดลอ่านเจตนา อารมณ์ และสัญญาณการซื้อ เทียบกับแคตตาล็อก ราคา และโทนเสียงของแบรนด์คุณ
พูด
โมเดลเสียงของเราตอบด้วยเสียงที่โคลนจากคุณ ในภาษาที่ผู้ชมพิมพ์เข้ามาจริง ๆ
แสดง
โมเดลอวาตารของเราเรนเดอร์คำตอบพร้อมลิปซิงก์ทีละเฟรม แล้วส่งขึ้นไลฟ์ทันที
ให้ผู้ช่วย AI ตั้งค่าไลฟ์ให้คุณ
Luqira รองรับ MCP โปรโตคอลที่ไคลเอ็นต์ AI ใช้เชื่อมต่อกับเครื่องมือภายนอก เชื่อมต่อครั้งเดียว ผู้ช่วยก็เปิดบัญชี เลือกแพ็กเกจที่พอดี เขียนสคริปต์ และเพิ่มสินค้าเข้าคลังให้ได้ ไลฟ์ครั้งแรกของคุณจึงเริ่มจากบทสนทนา ไม่ใช่การตั้งค่าทั้งบ่าย
- ชี้ไคลเอ็นต์มาที่ Luqira — มี endpoint เดียว ไม่ต้องสร้าง API key วางลงใน ChatGPT, Claude, Codex หรือไคลเอ็นต์ที่คุณใช้อยู่
- อนุมัติในเบราว์เซอร์ของคุณ — ผู้ช่วยจะส่งลิงก์และรหัสสั้น ๆ ให้ คุณล็อกอินบนหน้าเว็บของ Luqira แล้วกดอนุมัติ ผู้ช่วยไม่เห็นรหัสผ่านของคุณเลย
- บอกสิ่งที่ต้องการ — เปิดบัญชี เลือกแพ็กเกจ สคริปต์สำหรับคืนนี้ หรือสินค้าที่ดึงจากลิงก์ร้านค้าโดยตรง คุณคุยไป ระบบตั้งค่าไป
Chat
ไคลเอ็นต์ MCP ใดก็ได้
ตั้งค่า Luqira สำหรับคืนนี้ และเพิ่มสินค้า 3 รายการนี้ให้หน่อย
เปิดลิงก์นี้แล้วอนุมัติรหัส 4F2C-91KD จากนั้นที่เหลือผมจัดการให้
- เชื่อมต่อบัญชีแล้ว
- เลือกแพ็กเกจแล้ว ลิงก์ชำระเงินพร้อม
- เขียนและบันทึกสคริปต์เปิดรายการแล้ว
- นำเข้าสินค้า 3 รายการจากลิงก์ของคุณแล้ว
| title | desc |
|---|---|
| ไม่เห็นรหัสผ่านของคุณ | การล็อกอินเกิดขึ้นบนหน้าเว็บของ Luqira ในเบราว์เซอร์ของคุณเอง |
| ไม่เก็บข้อมูลเข้าสู่ระบบ | การเชื่อมต่อคืนค่าเป็นรหัสอ้างอิงที่ไม่มีความหมายนอก Luqira |
| ไม่ตัดเงินจากบัตรของคุณ | ผู้ช่วยส่งลิงก์ชำระเงินให้ได้เท่านั้น คุณเป็นคนชำระเงินเองบนหน้าชำระเงินที่ปลอดภัย |
โครงสร้างพื้นฐานที่วางใจได้
ความปลอดภัยระดับองค์กร
เข้ารหัสระหว่างส่งด้วย TLS 1.3 และเข้ารหัสข้อมูลที่จัดเก็บด้วย AES-256 ส่วนการโคลนเสียงจะไม่ทำงานหากเจ้าของเสียงไม่ยินยอม รายการมาตรการทั้งหมดอยู่ในหน้าความปลอดภัยของเรา
อ่านหน้าความปลอดภัย
SLA อัปไทม์ 99.9%
เป็นตัวเลขที่ผูกพันตามสัญญาบนโครงสร้างพื้นฐานหลายภูมิภาคที่สลับระบบอัตโนมัติ ไม่ใช่แค่ความตั้งใจ ระบบส่งข้อมูลแบบ edge ทั่วโลกช่วยให้ latency ต่ำในวันที่รายได้ขึ้นอยู่กับไลฟ์
API เปิดและการเชื่อมต่อระบบ
เชื่อม Luqira เข้ากับ CRM, OMS, ระบบวิเคราะห์ และหน้าร้านของคุณ เอกสาร API เปิดให้อ่านได้โดยไม่ต้องมีคีย์
อ่านเอกสาร API
ทีมซัพพอร์ตเฉพาะคุณ
เริ่มต้นใช้งานแบบมีทีมดูแล อบรมการใช้งาน และทีมดูแลบัญชีที่รับผิดชอบผลลัพธ์ไปด้วยกันกับคุณ