La capacité vocale de Saj Sense
Une IA vocale qui ne quitte jamais l'appareil.
Transcription, synthèse vocale, mots de réveil et plus encore. Chaque moteur, de la détection des mots de réveil à la synthèse vocale, s'exécute sur l'appareil sans aucune dépendance au cloud. L'arabe, l'hindi et l'ourdou sont intégrés dès la base, aux côtés de l'anglais.
Développé en Rust par SGH WLL, avec des centaines de tests réussis et un portefeuille de brevets déposé.
Un mot d'activation par langue. Choisissez-en un et suivez son fil à travers le pipeline.
saj-wakeInférence en moins de 1 ms, modèle sous 1 MoFonctionne en Anglaissaj-detectFonctionne en Anglaissaj-listenFonctionne en Anglaissaj-intentFonctionne en Anglaissaj-speak-ttsFonctionne en AnglaisUn fil passe par l'œil de chaque étape qui s'exécute dans sa langue et passe sous les autres.
Une IA vocale qui respecte vos utilisateurs.
Confidentiel dès le premier mot
Votre voix ne quitte jamais votre appareil. Aucun traitement cloud, aucune conservation des données et aucune télémétrie. La conformité au GDPR, à HIPAA et à NESA découle de l'architecture elle-même.
L'arabe dès la base
L'arabe, l'hindi et l'ourdou sont intégrés dès la base, aux côtés de l'anglais. Aucun d'entre eux n'a été ajouté ultérieurement comme couche de traduction.
Toutes les plateformes
iOS, Android, Linux, Windows, macOS, Raspberry Pi, WASM et MCU. Un cœur Rust avec des liaisons natives vous permet de déployer sur téléphones, enceintes, appareils embarqués et navigateurs.
Chaque moteur fonctionne sur l'appareil.
Aucun aller-retour vers le cloud, les fonctionnalités vocales que vous déployez continuent de fonctionner hors ligne, partout. Chaque moteur est sa propre crate Rust, et ensemble ils embarquent plus de 70 modèles entraînés.
Écouter
saj-wakeDétection de mots-clés personnalisés sur une architecture neuronale légère, avec des modèles de moins de 1 Mo.
saj-detectDétection neuronale de l'activité vocale avec une latence inférieure à la milliseconde.
saj-listenTranscription en temps réel.
saj-scribeTranscription de fichiers avec un encodeur et un décodeur séparés.
saj-intentExtraction directe de l'intention qui transforme les commandes vocales en actions en évitant le passage par le texte.
Parler
saj-speak-ttsSynthèse naturelle sur l'appareil.
saj-cloneClone une voix à partir d'échantillons, sur l'appareil.
Qui parle
saj-voicePlongements de locuteur pour la vérification et l'identification.
saj-whoSegmentation du locuteur en temps réel qui vous indique qui a parlé et quand.
saj-cleanSuppression neuronale légère du bruit.
Connecter
saj-pipelineUne interaction vocale qui exécute le mot de réveil, l'activité vocale, la reconnaissance vocale, l'intention et la synthèse vocale en une seule ligne.
saj-codecCodec vocal neuronal avec des profils de qualité de 1.2 à 6.0 kbps, en temps réel sur le processeur.
saj-senseFlux de jetons unifiés avec chiffrement par modalité.
saj-linkMessagerie chiffrée de bout en bout avec expéditeur scellé.
saj-serverREST et WebSocket avec une API compatible OpenAI et Deepgram. Multi-locataire, et fonctionne dans Docker.
L'arabe dans les fondations, dialecte par dialecte.
Plus de 420 millions de personnes parlent arabe, et 1,09 milliard parlent arabe, hindi ou ourdou.
| Dialecte | Couverture | Statut |
|---|---|---|
| الفصحىArabe standard moderne | Mot d'activation, STT, TTS et intention. Le registre formel des locuteurs de plus de 420 millions. | Supporté |
| الخليجيGolfe | Mot d'activation, STT et TTS. Réglé pour les Émirats arabes unis, l'Arabie saoudite, Bahreïn, le Koweït, le Qatar et Oman. | Supporté |
| المصريÉgyptien | Plus de 100 millions de locuteurs, et le dialecte arabe le plus largement compris dans le monde. | Planifié |
| الشاميLevantin | Syrie, Liban, Jordanie et Palestine, avec plus de 30 millions de locuteurs. | Planifié |
Mots d'activation arabes disponibles
- يا ساجYa Saj
- يا بيلاYa Bella
- اوكي ساجOk Saj
- Personnalisé
IA vocale d'entreprise pour la région MENA
Les banques, les opérateurs télécoms et les agences gouvernementales du Golfe ont besoin d'une IA vocale qui traite l'arabe sur l'appareil, avec une conscience des dialectes, un traitement souverain des données et une conformité NESA incluse.
Contactez les ventes entreprisesPourquoi sur l'appareil ?
Les API vocales cloud facturent à la minute, laissent fuiter les données et ajoutent de la latence. L'exécution sur l'appareil corrige ces trois problèmes.
Confidentialité totale
Aucune donnée audio ne quitte l'appareil. Aucun traitement cloud et aucune conservation des données.
Mot de réveil sub-milliseconde
L'inférence du mot de réveil en moins d'une milliseconde, contre un aller-retour cloud de 200 à 500 ms, de sorte que l'interaction vocale se déroule en temps réel sans attendre le réseau.
Aucune facturation à la minute
Aucune facturation à l'heure audio. Vos modèles s'exécutent sur votre matériel.
Comment obtenir Saj Speak.
Saj Link est l'application que vous utilisez tous les jours. Saj Speak, Saj See et Saj Codec sont des modules de capacités internes qui apparaissent via Saj Sense Business+, l'API développeur hébergée et les engagements OEM ou embarqués. Ils ne sont jamais vendus comme marques distinctes.
Saj Speak
Saj Sense Business+
Saj Speak apparaît dans l'offre Saj Sense Business+.
API développeur hébergée
Saj Speak est également disponible via l'API développeur hébergée.
OEM / Embarqué
Saj Speak dans votre propre appareil ou produit, via un engagement OEM ou embarqué.
Construit sur Saj Speak
Obtenez Saj Link.
Communication d'équipe chiffrée avec Bella AI intégrée. Le protocole post-quantique est construit et en cours de déploiement. Disponible maintenant pour macOS et le web.
iOS sur TestFlightAndroid et Windows arrivent bientôt.
- Chiffrement de bout en bout
- Expéditeur scellé, et chiffrement de bout en bout pour les messages et les médias partagés. L'audio des appels est relayé et n'est pas encore chiffré de bout en bout.
- Intelligence vocale
- Transcription, traduction et recherche sur l'appareil qui comprennent les dialectes.
- Conception axée sur l'arabe
- Mise en page native de droite à gauche, conscience des dialectes, et messages vocaux sous forme de cartes riches.