Saltar al contenido
Saj Speak
Idioma: Español
Abrir Saj Link

La capacidad de voz de Saj Sense

IA de voz que nunca sale del dispositivo.

Transcripción, síntesis de voz, palabras de activación y más. Cada motor, desde la detección de palabras de activación hasta la síntesis de voz, se ejecuta en el dispositivo sin ninguna dependencia de la nube. El árabe, el hindi y el urdu están integrados en la base junto con el inglés.

Construido en Rust por SGH WLL, con cientos de pruebas superadas y una cartera de patentes presentada.

Una palabra de activación por idioma. Elija una y siga su hilo a través del pipeline.

Palabra de activaciónsaj-wakeInferencia en menos de 1 ms, modelo de menos de 1 MBSe ejecuta en Inglés
Actividad de vozsaj-detectSe ejecuta en Inglés
Escucharsaj-listenSe ejecuta en Inglés
Intenciónsaj-intentSe ejecuta en Inglés
Hablarsaj-speak-ttsSe ejecuta en Inglés

Un hilo pasa por el ojo de cada etapa que se ejecuta en su idioma y pasa por debajo del resto.

IA de voz que respeta a sus usuarios.

  • Privacidad desde la primera palabra

    Su voz nunca sale de su dispositivo. No hay procesamiento en la nube, ni retención de datos, ni telemetría. El cumplimiento de GDPR, HIPAA y NESA proviene de la propia arquitectura.

  • Árabe desde la base

    El árabe, el hindi y el urdu están integrados en la base junto con el inglés. Ninguno de ellos se añadió posteriormente como una capa de traducción.

  • Todas las plataformas

    iOS, Android, Linux, Windows, macOS, Raspberry Pi, WASM y MCU. Un núcleo en Rust con bindings nativos le permite desplegar en teléfonos, altavoces, dispositivos integrados y navegadores.

Todos los motores se ejecutan en el dispositivo.

No hay ida y vuelta a la nube, por lo que las funciones de voz que implemente seguirán funcionando sin conexión, en todas partes. Cada motor es un crate de Rust independiente y, en conjunto, incluyen 70+ modelos entrenados.

Escuchar

Palabra de activaciónsaj-wake

Detección de palabras clave personalizadas sobre una arquitectura neuronal ligera, con modelos de menos de 1 MB.

InglésÁrabeHindiUrdu
Actividad de vozsaj-detect

Detección neuronal de actividad de voz con latencia inferior a un milisegundo.

Conversión de voz a texto en streamingsaj-listen

Transcripción en tiempo real.

InglésÁrabeHindiUrdu
Conversión de voz a texto por lotessaj-scribe

Transcripción de archivos con un codificador y un decodificador separados.

Intención de vozsaj-intent

Extracción directa de intenciones que convierte los comandos de voz en acciones y omite el texto.

InglésÁrabe

Hablar

Conversión de texto a vozsaj-speak-tts

Síntesis natural en el dispositivo.

InglésÁrabeHindi
Clonación de vozsaj-clone

Clona una voz a partir de muestras, en el dispositivo.

InglésÁrabe

Quién habla

Identificación del hablantesaj-voice

Incrustaciones de hablante para verificación e identificación.

Diarizaciónsaj-who

Segmentación de hablantes en tiempo real que indica quién habló y cuándo.

Supresión de ruidosaj-clean

Eliminación neuronal ligera de ruido.

Conectar

Pipelinesaj-pipeline

Una interacción de voz que ejecuta la palabra de activación, la actividad de voz, la conversión de voz a texto, la intención y la conversión de texto a voz en una sola línea.

Códec neuronalsaj-codec

Códec neuronal de voz con perfiles de calidad de 1.2 a 6.0 kbps, en tiempo real en la CPU.

Detección multimodalsaj-sense

Flujos de tokens unificados con cifrado por modalidad.

Comunicaciones cifradassaj-link

Mensajería cifrada de extremo a extremo con remitente sellado.

Servidor autohospedadosaj-server

REST y WebSocket con una API compatible con OpenAI y Deepgram. Multiinquilino y se ejecuta en Docker.

El árabe en la base, dialecto a dialecto.

Más de 420 millones de personas hablan árabe, y 1.09 mil millones hablan árabe, hindi o urdu.

Cobertura de dialectos del árabe
DialectoCoberturaEstado
الفصحىÁrabe estándar modernoPalabra de activación, STT, TTS e intención. El registro formal de 420M+ hablantes.Compatible
الخليجيÁrabe del GolfoPalabra de activación, STT y TTS. Ajustado para Emiratos Árabes Unidos, Arabia Saudita, Bahréin, Kuwait, Catar y Omán.Compatible
المصريEgipcio100M+ hablantes, y el dialecto árabe más ampliamente comprendido en todo el mundo.Planificado
الشاميLevantinoSiria, Líbano, Jordania y Palestina, con 30M+ hablantes.Planificado

Palabras de activación en árabe disponibles

  • يا ساجYa Saj
  • يا بيلاYa Bella
  • اوكي ساجOk Saj
  • Personalizada

IA de voz empresarial para MENA

Los bancos, las empresas de telecomunicaciones y los organismos gubernamentales del Golfo necesitan una IA de voz que procese el árabe en el dispositivo, con conciencia dialectal, procesamiento soberano de datos y cumplimiento de NESA incluido.

Contacte con ventas para empresas

¿Por qué en el dispositivo?

Las API de voz en la nube cobran por minuto, filtran datos y añaden latencia. Ejecutarlo en el dispositivo soluciona los tres problemas.

En el dispositivoPalabra de activación en menos de 1 ms
Ida y vuelta a la nube200 a 500 ms
Se reproduce diez veces más lento para que pueda verlo.
  • Privacidad total

    Ningún dato de audio sale del dispositivo. Sin procesamiento en la nube y sin retención de datos.

  • Palabra de activación por debajo del milisegundo

    La inferencia de la palabra de activación en menos de un milisegundo, frente a un recorrido de ida y vuelta a la nube de 200 a 500 ms, de modo que la interacción por voz ocurre en tiempo real sin esperar a la red.

  • Sin cargos por minuto

    No hay facturación por horas de audio. Sus modelos se ejecutan en su hardware.

Cómo obtener Saj Speak.

Saj Link es la aplicación que utiliza a diario. Saj Speak, Saj See y Saj Codec son módulos de capacidades internos que se ofrecen a través de Saj Sense Business+, la API de desarrollador alojada y acuerdos OEM o integrados. Nunca se venden como marcas independientes.

Saj Speak

  • Saj Sense Business+

    Saj Speak aparece en el nivel Saj Sense Business+.

  • API de desarrollador alojada

    Saj Speak también está disponible a través de la API de desarrollador alojada.

  • OEM / Integrado

    Saj Speak dentro de su propio dispositivo o producto, mediante un acuerdo OEM o integrado.