🎤 Reconocimiento de voz: control por voz para Scratch #
La extensión de reconocimiento de voz incorpora control por voz real a Scratch.
Te permite capturar palabras habladas y convertirlas en texto, habilitando comandos de voz, dictado, proyectos de aprendizaje de idiomas y juegos interactivos controlados por voz, todo en tiempo real y directamente en tu navegador.
Lo suficientemente sencillo para principiantes, lo suficientemente potente para aulas creativas. ✨
🌟 Descripción general #
- Conversión de voz a texto: Captura palabras habladas y úsalas en tus proyectos de Scratch.
- Compatibilidad con varios idiomas: reconoce el habla en más de 25 idiomas, incluidos inglés, español, francés, alemán, árabe, persa, chino, japonés, coreano y muchos más.
- Reconocimiento en tiempo real: Obtenga transcripción instantánea de las palabras habladas.
- Fácil integración: utilice bloques sencillos para empezar a escuchar y recuperar el texto reconocido.
- Conversión de números: Convierta dígitos persas/arábigos a números ingleses para facilitar su procesamiento.
- Basado en el navegador: Funciona en Chrome, Microsoft Edge y la mayoría de los navegadores basados en Chromium que admiten la API de reconocimiento de voz web.
✨ Características principales #
- Más de 25 idiomas compatibles con múltiples variantes regionales.
- API de reconocimiento de voz integrada en el navegador (Web Speech API).
- Comando sencillo de escucha y espera para la captura de voz síncrona.
- Cambio de idioma sobre la marcha para proyectos multilingües.
- Funciona directamente a través de tu navegador: rápido y con gran capacidad de respuesta.
- No requiere configuración ni claves API; funciona automáticamente con la API integrada de su navegador.
🚀 Cómo usar #
- Ve a: pishi.ai/play
- Abre la sección Extensiones.
- Seleccione la extensión de reconocimiento de voz.
- Permita el acceso al micrófono cuando su navegador se lo solicite.
- Configurar idioma: Utilice el bloque "fijar idioma a [IDIOMA]" para elegir el idioma que desee (el idioma predeterminado es inglés).
- Comience a escuchar: utilice el bloque "escuchar y esperar"; la extensión comenzará a escuchar su micrófono y esperará a que hable.
- Recuperación de voz: Después de hablar, el texto reconocido se almacena y se puede recuperar utilizando el bloque de informe "frase".
- Uso en proyectos: ¡Combínalo con otros bloques para crear juegos controlados por voz, herramientas de dictado, actividades de aprendizaje de idiomas y mucho más!
Consejos
- Hable con claridad y a un ritmo normal para obtener la mejor precisión de reconocimiento.
- Utilice un entorno tranquilo para minimizar la interferencia del ruido de fondo.
- Para idiomas con numerales distintos del inglés (árabe/persa), utilice el bloque "convertir dígitos persas/árabes a inglés" para normalizar los números.
- Funciona mejor en Chrome, Edge y otros navegadores basados en Chromium compatibles con la API de reconocimiento de voz web.
🧱 Bloques y funciones #
🎤 Captura de voz #
Comienza a escuchar el micrófono y espera a que se reconozca la entrada de voz.
Este es un comando de bloqueo - el script se detendrá hasta que se detecte y transcriba la voz, o hasta que se produzca un tiempo de espera o un error (aproximadamente 60 segundos).
Cómo funciona:
- Cuando se ejecuta este bloque, el navegador comienza a escuchar a través de tu micrófono.
- Habla con claridad; el sistema de reconocimiento transcribirá lo que digas.
- Una vez que se reconoce el habla, el texto se guarda y el bloque finaliza.
- Si no se detecta ninguna voz o se produce un error, el bloque finalizará con un resultado vacío.
Importante: Asegúrese de que los permisos del micrófono estén habilitados en la configuración de su navegador.
Informa sobre el último texto de voz reconocido capturado por el bloque "escuchar y esperar".
Devuelve el texto transcrito como una cadena de texto, o una cadena vacía si no se reconoció ninguna voz o se produjo un error.
Ejemplo:
- Si dices “hola scratch”, este bloque informará “hola scratch”.
- Utilice este bloque para mostrar el habla reconocida, comparar palabras, activar acciones o almacenar el habla en variables.
Indica el grado de confianza del sistema de reconocimiento de voz en el último resultado reconocido, mediante un número entre 0 y 1 (donde 1 significa 100 % de confianza).
Devuelve una cadena vacía si aún no se ha reconocido ningún resultado o si el resultado no tenía puntuación de confianza.
Nota: No todos los navegadores muestran el valor de confianza. Google Chrome lo devuelve de forma fiable; otros navegadores pueden mostrar una cadena vacía incluso después de un reconocimiento exitoso.
Cómo funciona:
- Una vez finalizado el proceso de "escuchar y esperar", este bloque devuelve un número decimal como 0,92 (que significa un 92 % de confianza).
- Un valor más alto significa que el navegador estaba más seguro de lo que escuchó.
- Un nivel de confianza bajo puede indicar que deberías pedirle al usuario que repita lo que dijo o que hable con más claridad.
Ejemplo:
- Utilice un bloque “if” para comprobar: si (confianza) > 0,8, acepte la respuesta; de lo contrario, pídale al usuario que lo intente de nuevo.
- Muestra el valor de confianza en pantalla mientras construyes y pruebas tu proyecto para comprender la calidad del reconocimiento.
Muestra la transcripción provisional mientras el reconocimiento de voz aún está en curso, antes de que se confirme el resultado final.
Se actualiza continuamente a medida que hablas, ofreciéndote una vista previa en tiempo real de lo que el navegador está escuchando.
Cómo funciona:
- Mientras se ejecuta la función "escuchar y esperar" y usted está hablando, este bloque refleja la mejor estimación que ha hecho el navegador hasta el momento.
- El valor cambia rápidamente a medida que el sistema de reconocimiento procesa cada sílaba o palabra.
- Una vez finalizado el reconocimiento, "frase" contiene la transcripción final confirmada y "frase en vivo" contiene el último texto provisional.
Ejemplo:
- Muestra el mensaje "frase en vivo" en una burbuja de diálogo en tu personaje para que el público pueda ver cómo aparecen las palabras en tiempo real mientras hablas.
- Úsalo para crear un efecto de subtitulado en vivo o de teleprompter dentro de tu proyecto.
Consejo: utilice la opción "siguiente palabra" para los comandos de voz: para proyectos que requieren reaccionar a palabras individuales, como un juego donde el jugador dice "saltar", "izquierda" o "fuego", el bloque "siguiente palabra" es más práctico que consultar directamente el "frase en vivo". Véase más abajo.
Extrae la palabra de la cola elegida y la devuelve, o una cadena vacía si la cola está vacía.
MODE: elija en directo (provisional, en tiempo real) o final (transcripción confirmada).
Cómo funciona:
- Mientras se ejecuta el proceso de "escuchar y esperar", cada actualización de la transcripción provisional del navegador se compara con el recuento de palabras visto anteriormente; las palabras recién añadidas se agregan a la cola de procesamiento en vivo. Cuando el navegador confirma el resultado final, todas las palabras de la transcripción final se agregan a la cola de procesamiento final de una sola vez.
- Cada vez que su script lea este bloque, la palabra en espera más antigua se eliminará atómicamente de la cola seleccionada y se devolverá.
- Si llegan varias palabras antes de que tu guion las lea, todas esperan en la cola; ninguna se pierde.
- Cola de reproducción en vivo: nunca se borra automáticamente. Las palabras de sesiones anteriores de "escuchar y esperar" permanecen hasta que el script las lea. La cola admite hasta 200 palabras; si se llena, las palabras más antiguas sin leer se eliminan para dejar espacio a las nuevas.
- Cola final: se vacía automáticamente cada vez que comienza una nueva sesión de "escuchar y esperar", por lo que solo se devuelven las palabras de la sesión actual.
- Devuelve un valor vacío cuando la cola seleccionada está vacía.
En directo o final: ¿cuál usar?
- en vivo - las palabras llegan más rápido (mientras sigues hablando), lo que resulta ideal para juegos en tiempo real y comandos rápidos. Ocasionalmente, pueden aparecer errores de revisión mientras el navegador ajusta su predicción a mitad de palabra.
- Final las palabras se confirman solo después de que el modelo de lenguaje del navegador finaliza la transcripción completa. Es más preciso, pero llega más tarde (después de que dejes de hablar). La cola final se reinicia con cada nueva sesión de "escuchar y esperar", por lo que no se conservan palabras de sesiones anteriores.
Uso típico - juego controlado por voz:
- Ejecuta la función "escuchar y esperar" en un único script (permanece activa mientras el usuario habla).
- En un bucle infinito separado, lee "siguiente palabra [en vivo]" en cada ciclo y reacciona a cada comando en el orden en que fueron pronunciados.
Nota: es posible que las palabras repetidas se cuenten de más. El proceso de reconocimiento final de Chrome vuelve a analizar el audio completo con un modelo de lenguaje, y para palabras idénticas repetidas, los límites acústicos son ambiguos; a veces, el modelo añade una instancia extra (por ejemplo, decir "everybody" tres veces puede producir cuatro). Este es un comportamiento del navegador que la extensión no puede corregir. Para evitarlo, utilice comandos cortos y fonéticamente distintos ("jump", "left", "fire").
🌍 Configuración de idioma #
Establece el idioma para el reconocimiento de voz.
LANGUAGE: elige entre un menú desplegable con más de 25 idiomas y variantes regionales compatibles.
Idiomas compatibles:
- Árabe (العربية)
- Persa (فارسی)
- Inglés (English)
- Inglés americano (en-US)
- Inglés británico (en-GB)
- Alemán (Deutsch)
- Español – Spain (Español)
- Español – América Latina (Español Latinoamericano)
- Francés (Français)
- Italiano (Italiano)
- Portugués (Português)
- Portugués – Brasileño (Português Brasileiro)
- Ruso (Русский)
- Turco (Türkçe)
- Ucraniano (Українська)
- Coreano (한국어)
- Japonés (日本語)
- Chino – Simplificado (简体中文)
- Chino – Tradicional (繁體中文)
- Hindi (हिंदी)
- Bengalí (বাংলা)
- Indonesio (Bahasa Indonesia)
- Azeri (Azəri)
- Kazajo (Қазақша)
- Uzbeko (Oʻzbekcha)
Nota: Es posible que algunos idiomas sean compatibles con Chrome, pero no con otros navegadores.
Por ejemplo, el persa (فارسی) funciona actualmente en Google Chrome, pero puede mostrar un error de red en Microsoft Edge.
Si un idioma no reconoce la voz, pruebe primero en Chrome.
Ejemplos de uso:
- Crea proyectos multilingües que cambien de idioma.
- Desarrollar herramientas de aprendizaje de idiomas que reconozcan palabras en diferentes idiomas.
- Hacer que los juegos controlados por voz sean accesibles para hablantes de muchos idiomas.
🔢 Conversión de números #
Convierte los números persas (۰-۹) o árabes (٠-٩) del texto de voz reconocido a dígitos ingleses (0-9).
Esto resulta útil para proyectos que requieren procesar números hablados en persa o árabe, facilitando su uso en operaciones matemáticas o comparaciones.
Cómo funciona:
- Detecta automáticamente los dígitos persas (0 1 2 3 4 5 6 7 8 9) y los convierte a (0 1 2 3 4 5 6 7 8 9).
- Detecta automáticamente los dígitos arábigos-índicos (٠ ١ ٢ ٣ ٤ ٥ ٦ ٧ ٨ ٩) y los convierte a (0 1 2 3 4 5 6 7 8 9).
- El texto convertido reemplaza el texto de voz original; llame a este bloque después de "escuchar y esperar" si es necesario.
Ejemplo:
Si el discurso reconocido es “شماره ۱۲۳” (número 123 en dígitos persas), después de la conversión el texto del discurso se convierte en “شماره 123” con dígitos en inglés.
Consejo: Utilice este bloque cuando trabaje con texto en persa o árabe para asegurarse de que los números estén en un formato que Scratch pueda usar fácilmente para realizar cálculos.
🎓 Usos educativos #
- Aprendizaje de idiomas: Crea herramientas para practicar la pronunciación: los estudiantes pronuncian palabras y el sistema revisa su pronunciación.
- Crea cuestionarios de vocabulario que respondan a las respuestas habladas.
- Desarrollar proyectos narrativos multilingües en los que los personajes respondan a comandos de voz en diferentes idiomas.
- Enseñar conceptos de accesibilidad: mostrar cómo el control por voz puede ayudar a las personas con discapacidad a interactuar con la tecnología.
- Explora el procesamiento del lenguaje natural: los estudiantes aprenden cómo las máquinas comprenden el habla humana.
- Crea juegos y simulaciones controlados por voz para practicar habilidades lingüísticas en contexto.
- Desarrollar herramientas de dictado para la práctica de la escritura y la narración creativa.
🎮 Proyectos de ejemplo #
- Juego de comandos de voz: Di “izquierda”, “derecha”, “saltar” para controlar un personaje.
- Bola Mágica 8: Haz una pregunta en voz alta y el duende te responderá.
- Calculadora por voz: Di problemas matemáticos como "¿cuánto es cinco más tres?" y un icono mostrará la respuesta.
- Prueba de idioma: Sprite pregunta "¿cómo se dice hola en español?" - el estudiante responde con su voz.
- Creador de historias: Dicta una historia y observa cómo aparece en la pantalla a medida que hablas.
- Selector de color: Di el nombre de un color y el objeto cambiará a ese color.
- Simulador de mascotas: Da órdenes de voz como "siéntate", "juega" o "duerme" a una mascota virtual.
- Anfitrión multilingüe: Habla en diferentes idiomas; el personaje detecta el idioma y responde en consecuencia.
🧩Pruébalo tú mismo: pishi.ai/play
🔧 Consejos y solución de problemas #
🎤 Consejos específicos para el reconocimiento de voz #
- ¿No funciona el micrófono? Comprueba los permisos del navegador: asegúrate de que el sitio tenga acceso al micrófono.
- ¿No reconoces el habla con precisión? Habla con claridad y reduce el ruido de fondo. Usa auriculares o un micrófono externo para una mejor calidad de sonido.
- ¿Se ha detectado un idioma incorrecto? Asegúrese de configurar el idioma correcto mediante “fijar idioma a [IDIOMA]” antes de escuchar.
- ¿Error de reconocimiento de voz no compatible? Esta extensión requiere Chrome, Edge u otro navegador basado en Chromium con compatibilidad con la API de reconocimiento de voz web. Safari y Firefox tienen compatibilidad limitada o nula.
- ¿No funciona el idioma en tu navegador? Algunos idiomas (como el persa) podrían no ser compatibles con Edge u otros navegadores. Para una mejor compatibilidad, prueba con Chrome.
- ¿Tiempo de espera agotado o no se detectó voz? El sistema espera aproximadamente 60 segundos para detectar voz; si no se detecta nada, se agotará el tiempo de espera y devolverá un texto vacío.
- ¿Los números no funcionan correctamente? Para el habla persa o árabe, utilice el bloque de conversión de números para normalizar los dígitos.
- ¿Varía la calidad del reconocimiento? La precisión del reconocimiento de voz depende del acento, la pronunciación y la claridad del habla; los resultados pueden variar entre usuarios.
- ¿Aparecen más palabras repetidas de las que se pronuncian? Este es un comportamiento conocido de los navegadores. El proceso de reconocimiento final de Chrome vuelve a analizar todo el audio con un modelo de lenguaje, y para palabras idénticas repetidas, los límites acústicos son ambiguos: el modelo a veces añade una instancia extra. Usa comandos cortos y distintos, y evita repetir la misma palabra como comando de juego.
- Conexión a Internet: La API de reconocimiento de voz web utiliza los servicios en la nube de Google para la mayoría de los idiomas; se necesita una conexión a Internet para que funcione el reconocimiento.
- Puedes detener el reconocimiento en cualquier momento deteniendo el script o recargando el proyecto.
🔒 Privacidad y seguridad #
- Esta extensión utiliza la API de reconocimiento de voz web integrada del navegador, que puede enviar audio a los servidores de Google para su procesamiento (dependiendo de la implementación del navegador).
- El audio se procesa únicamente para su transcripción; el texto de la voz se devuelve a su navegador y no se almacena en esta extensión.
- El audio es procesado por su navegador mediante la API de voz web; Pishi.ai y Scratch nunca reciben ni almacenan ningún dato.
- Pishi.ai y Scratch no guardan ni transmiten datos personales ni grabaciones de voz.
- Revisa siempre la configuración de privacidad y los permisos de tu navegador para el acceso al micrófono.
🧪 Información técnica #
- API: API de voz web (SpeechRecognition / webkitSpeechRecognition)
- Navegadores compatibles: Chrome, Edge y la mayoría de los navegadores basados en Chromium que admiten la API de reconocimiento de voz web.
- Idiomas: Más de 25 idiomas y variantes regionales.
- Tiempo de espera: Aproximadamente 60 segundos de escucha por cada llamada de "escuchar y esperar".
- Modo de reconocimiento: Reconocimiento de una sola toma (una locución por llamada de escucha; el modo continuo no es compatible).
- Resultados provisionales: Activado: las actualizaciones de "frase en vivo" se realizan en tiempo real mientras se está emitiendo el discurso.
- Puntuación de confianza: Proporcionada por el navegador como un valor decimal de 0 a 1; disponible a través del informe de "confianza" una vez finalizado el reconocimiento.
- Se requiere conexión a Internet: Sí. La API de voz web normalmente utiliza procesamiento basado en la nube para la transcripción.
- Conversión de números: admite la conversión de persa (۰-۹) y árabe-índico (٠-٩) a inglés (0-9).
- Privacidad: El audio es procesado por la API del navegador – Pishi.ai Scratch nunca almacena tu voz.
🔗 Extensiones relacionadas #
- 🔊 Texto a voz - convierte texto en audio hablado
- 💬 ChatGPT - genera respuestas inteligentes, mantén conversaciones o crea chatbots que entiendan y respondan a tu voz.
- 🌐 Traducir - traduce el habla reconocida a otros idiomas para proyectos multilingües o interpretación en tiempo real.
- 🏫 Máquina de enseñanza de Google utiliza tus propios modelos entrenados para reconocer sonidos, imágenes o poses creadas en Google Teachable Machine.
📚 Más información #
- Ayuda con las extensiones de IA en pishi.ai
- Documentación de la API de reconocimiento de voz web
- Ideas para rascar
