sábado, 7 de octubre de 2023

XTTS: ¡alternativa a eleven labs, y gratis!

Hola amigos, ¿cómo están?.

quería contarles  sobre una nueva inteligencia artificial de texto a voz, que es capaz de clonar tu voz con tan solo 3 segundos de audio!.

Hasta hace poco, eleven labs era la única manera confiable de clonar tu voz con alta calidad y  con pocos datos, sin embargo hay que pagar para tener esa funcionalidad.

Pero no hace mucho, exactamente hace dos semanas, Coqui tts lanza xtts, un revolucionario sistema de texto a voz con AI, que es capaz de clonar tu voz empezando con 3 segundos de audio!.

Xtts es basado en coqui tts, que a su  vez es hecho sobre tortoice tts.

Su interface es altamente buena, con la capacidad de expresar emociones dependiendo del archivo de audio que le cargues.

Y la clonación de voz desde 3 segundos de audio es ya demasiado!, aunque suele fallar a veces en el intento, hay veces que lo hace muy bien.

En las versiones que están circulando por ahí de xtts, por ahora puede clonar tu voz desde 3 segundos de audio hasta 20 segundos nomas.

Soporta 13 idiomas, todo el poderío de coqui tts, incluyendo síntesis arbitraria, y síntesis bajo emociones, que también ha sido implementado en xtts.

Por ahora, hay dos maneras de  acceder a esta tecnología.

Por medio de Hugging Face, hay dos espacios o dos demos programados ahí, para probarlo.

La otra es por la página oficial de coqui studio, que desde hace poco implementaron xtts.

Como usar los espacios de Hugging Face.

Existen dos, uno oficial hecho por coqui, y otro enteramente en español hecho por un usuario.

En el caso de la oficial de coqui, ya est encendida y solo toca esperar que cargue.

Una vez cargado, selecciona el idioma, escribe un texto que quieras, cargas un audio de referencia, que tenga de entre 3 a 20 segundos y después de darle a la casilla de agree, le das a submit.

Ese texto es leído con el audio que has puesto, en el idioma que has escogido.

Xtts soporta 13 idiomas, incluido el español.

Al igual que eleven labs, reconoce cuando escribes en español latino o de España, y con los signos de exclamación se hace más expresivo.

La página española en cambio anda algo dormida, pero sabemos cómo despertarla.

Entras y le das donde dice, re star space, tomara unos minutos a que cargue todo, y esta vez el entorno es enteramente en español, y es una versión de tts que solo soporta español también.

Si prefieres probarlo por la página de coqui studio, que incluso es más generosa que eleven labs, lo puedes hacer activando en la página xtts.

Coqui studio se parece mucho a eleven labs, sus síntesis es rápida vesada en coqui tts, soporta emociones, 13 idiomas, y c clonación de voz.

Las limitaciones de los espacios en Hugging Face es que.

1: solo puedes subir un audio desde 3 a 20 segundos, si subes algo más largo el sistema se cuelga.

2: para escribir texto solo te acepta de 2 a 4 oraciones, sin importar cuantos caracteres uses.

3: a veces las voces clonadas no suenan igual como el archivo de referencia, no sé a qué se deba esto, pero hay momentos en que la clonación es bastante parecida y exacta, pero hay momentos que tiene su margen de error y la voz no se parece ni en sueños  al archivo de referencia.

Usarlo desde coqui studio.

Después de registrarte en la página de coqui studio, te encontrarás con lo que te ofrece la versión gratuita.

15 mil caracteres por mes!, y clonar tu voz usando xtts de 3 a 30 segundos de audio.

Hay versiones Premium de coqui studio, que te ofrecen más caracteres y la clonación de voces también tiene más tiempo.

Por ejemplo por 8 dólares al mes, puedes tener hasta 50 mil caracteres, clonar tu voz con xtts hasta 3 minutos de audio.

Nota importante.

Si estas en coqui studio, y usas las voces standard si escribes 150 caracteres, se quedan en 150.

Pero si activas la casilla de xtts, aunque hayas escrito 150 caracteres de los 15 mil que te dan, se ocupa el doble, terminarías usando 300 caracteres.

Aquí he preparado un demo de xtts.

Tomé la voz sueca de piper tts, y luego escribí un texto en español.

En el ejemplo que escucharán, primero sonará la voz sueca de piper tts y a continuación un texto que escribí en español clonándola con xtts.

https://audio.com/milton-paredes/audio/xtts1

 

enlaces:

Espacio de huggin fase oficial de coqui.

https://huggingface.co/spaces/coqui/xtts?duplicate=true

espacio de huging fase en español.

https://huggingface.co/spaces/mrm8488/xtts-spanish

demo de coqui studio, aprovechen su plan gratuito!.

https://app.coqui.ai/studio/3bc9ae37-a8b2-4aff-aca9-18ca4d955677/

 

 

jueves, 5 de octubre de 2023

Reality 1.5, se resiste a morir pero tampoco avanza

Hola chicos,  hoy quiero comentarles de un software sintetizador que en los 90 ha sido uno de los pioneros en ser multisíntesis y sampling a la vez.
Y a pesar de que en estos años los mismos creadores lo han vuelto a revivir, parece estar estancado en el tiempo.
Reality 1.5 fue un software sintetizador virtual que funcionaba en Windows 95 y 98.
Fue creado en 1997 por la empresa Seer systems.
En su primera versión 1.0, estaba optimizado para Windows 95, pero en versiones siguientes fue consolidándose como el sintetizador mas profesional en Windows 98.
Reality era único, como usuario del producto por mucho tiempo lo puedo asegurar.
Tenía 5 tipos de síntesis.
1: por muestras.
El fuerte de reality es que era un sintetizador bazado en samples, y tenia sonidos bastante realistas para su época.
Dentro de reality podías cargar tus propios wavs, sea en mono o stereo, cualquier frecuencia de muestreo mientras sea a 16 bit, y con eso creabas tus propios instrumentos
Se te  daba la obcion también de cargar soundfonts lo cual se te abría una puerta grandísima a miles de sonidos.
Su formato era seer-bankset.
El banco de sonidos que venia de fabrica, cuyo peso era de 24 mb, venía  aproximadamente 400 sonidos los cuales mezclaba los 5 tipos de síntesis que soportaba reality.
También había un banco general midi de 10 mb, que sonaba muy bien y en midis sonaba super balanceado y conciso.
La mayoría de los sonidos sampleados de reality tanto para el banco principal como el de general midi, son bazados en el teclado Alesis quadrasynth, de hecho muchos hemos llegado a pensar que reality en el apartado samples sonaba idéntico al alesis quadrasynth o el qs8.
De hecho el sonido de piano que contiene estos bancos es bazado en el alesis qs8.
En el apartado samples tiene 4 osciladores, que puedes modificarlos a tu gusto, creando inumerables capas para tener instrumentos mas realistas que soporten de momento  velocity switch.
Analógico virtual.
En este  apartado reality también tenia lo suyo.
Su lado de synth, tiene 5 formas de onda:
Sinusoidal, diente de cierra, cuadrada, tryangulo, y ruido blanco.
Puedes  cconbinarlas como tu quieras, ya que tiene 4 osciladores en este apartado.
Tanto la parte análoga como la de samples tiene sus envolventes, attack, sustain, hold, y release.
Tiene filtros que actúan independiente para cada oscilador, o podias hacer que en un patch el filtro actue para todos los osciladores.
Como sintetizador análogo substractivo, hacia un lindo papel en tu música.
Dentro del banco de sonidos que viene de fábrica hay varios presets con esta característica.
Síntesis fm.
A pesar de que  aquí también hay 4 osciladores, si quieres crear un patch en formato fm solo podías hacerlo con dos osciladores, uno que tenga la forma de onda deseada  preferible sinusoidal, y el otro que la module.
En el apartado fm le falta mucho por retocar, los parámetros son limitados, pero puedes sacar sonidos interesantes, pues solo es de dos operadores.
Modelado físico.
Reality también tiene este interesante tipo de síntesis.
Para esto  fue posible pedir colaboración con la empresa Sondius, la misma que patentó para Yamaha el modelado físico para sus productos.
El mismo tipo de modelado físico creado por Sondius, lo encontramos en reality, aunque, en una versión mas reducida y con pocos parámetros.
En este apartado pocos instrumentos pueden ser recreados.
En especial el modelado de campanas e instrumentos metálicos, sonido de flauta dulce, o su marca registrada, la guitarra rock con distorsión.
Modal synthesis.
Este tipo de síntesis no se entiende por que se ha incluido, pero permite a los diseñadores de sonidos, usar los 4 sintesis existentes, copiarlos cada uno a uno de los 4 osciladores, y mezclarlos para nuevas posibilidades sonoras.
Polifonía.
Reality n su versión 1.0 tenía 64 voices de polifonía, que luego en la versión 1.5 subió a 128, y en su ultima versión 1.5.7, llego a tener 512 voces de polifonía, algo impensable en máquinas de la época.
Su propio driver de audio y midi.
Reality permitió a músicos de bajo presupuesto tener un sonido de calidad y full dúplex  gracias a su audio driver.
Los que en ese tiempo hemos  tenido máquinas que eran solo haft dúplex, agradecemos esa adición en reality, por que por fin, en Windows 98 con tu tarjeta de audio básica, podias ttener sonido full dúplex  y usar varias aplicaciones de audio a la vez, incluyendo: reality, cake walk, y jaws al mismo tiempo.
También gozaba de baja latencia, de hecho reality era el único sintetizador que aseguraban tener latencia a 2 ms, casi a 0.
Su driver de audio era único, super claro, con la capacidad de ser full dúplex, y según palabras de sus creadores, era un procesador de audio 80 bit, que no podía ser imitado jamás en otro programa igual.
A pesar de que ya eso lo han liberado en estos años para revivir a este sintetizador.
Tambien se instalaba un driver midi, que hacía posible que puedas escuchar midis usando sonidos de reality, o secuenciar con cakewalk.
De hecho en mi modesta laptop de aquellos años mi configuración era.
Cakewalk pro audio 9, reality o ssur real, y algunos soundfonts que podía conseguirlos en la red.
Su precio?, $499 dólares.
Sur real.
Seer systems lanza entonces una aplicación bazada en reality pero con menos cosas llamada sur real.
Sur real es una versión recortada de reality, pensada mas como player que como sampler.
Soportaba el formato seerbankset, los mismos tipos de síntesis de su hermano mayor, el mismo driver de audio de baja latencia, pero a pesar de ser casi igual tenía sus diferencias.
El lado sampler ha sido quitado, la polifonía es de 64 voces, y en su versión 1.5.7, llego a tener 128 voces de polifonía.
Y a pesar de que no puedes cargar samples directamente, puedes crear tu propio banco de sonidos mezclando instrumentos de otros bancos.
Sur real también soporta soundfonts, así  que tambi´n podias cargar tu sf2 favorito .
Precio, $99.
Les cuento que yo si llegué a  comprar sur real, en el año 2000, asi que mi copia de sur real siempre ha sido legal.
En sus últimos años de vida, se nos permitió a los usuarios de sur real hacer un upgrade o actualización a reality sin costo alguno, solo llenando un formulario con todos los datos, incluyendo tu numero de serie real.
Y aí los que hemos podido llenar los datos correctamente, tuvimos  reality gratis sin limitaciones.
Seer Music.
Esta es otra aplicación de ser systems, bazado el el motor de reality, ahora si gratis, que permitía a usuarios poder  escuchar música creada en este formato.
Al instalarlo ya viene un banco modificado bazado en el general midi de reality, con otros sonidos usando los 5 tipos de síntesis.
La persona que escuchaba la música creada en formato ser Music podía hacer un streaming sin descargarse nada y remezclarla a su antojo.
Y cómo creábamos este tipo de música?.
Tan fácil como  abrir reality o sur real cargar nuestro banco,  cargar el midi file asignado a eso, y guardarlo en formato ser Music.
Olvide decir que tanto reality como sur real también eran reproductores midi, podías cargar midis ahí, y escucharlos, también te daba la obcion de cargar un midi con sonidos  personalizados y cargarlos y exportarlos en formato ser Music para que el mundo pueda oír tus creaciones.
Ser wave maker.
Y para completar el paquete, hay ser wave maker, esto añade  a la aplicación ser Music la capacidad de convertir esta música en formato wav.
Precio: $49.
Demos.
En aquellos tiempos podíamos probar reality o sur real antes de comprarlos, y en cuanto a ser Music ese programa ha sido gratis siempre.
Ambos programas tanto reality como ssu hermano menor sur real, tenían las mismas limitaciones en versión demo.
No se te limitaba el uso del programa, podias probar los presets y bajarte los bancos gratis para probar el programa.
Pero: el demo duraba 20 minutos por seción, y al termino de los 20 minutos tocaba reiniciar la compu.
Y a parte de eso, el demo tenía una duración de 5 días.
Durante los 5 dias de prueba, podías abrir y reabrir reality y usarlo por 20 minutos por secion, hasta el termino de los 5 días cuando el demo dejaba de funcionar.
Nueva página y torres con reality preinstalado.
Con el advenimiento de Windows xp, y luego Windows 7, 8, y 10, reality dejó de funcionar para estos sistemas.
Muchos hemos pedido su regreso, tanto como aplicación como plugin vst, y a pesar de sus esfuerzos vanos de actualizarse, no lo han hecho del todo.
Se hizo una nueva pagina que es seersound.com
En la cual ofrecen tener reality comprando una compu con Windows 98 preinstalado.
Lo que hicieron fueron venderte una CPU con Windows 98 preinstalado, y reality también instalado el el sistema.
Venia con salidas analógicas y salidas digitales, y un puerto u s b a u s b adaptador para que la compu reconozca la otra compu como unidad de almacenamiento.
Naturalmente el aalmacenamiento que tenían estas maquinas era poco como de 4 o 8 gb nomás, considerando que están optimizadas para Windows 98.
Y nos dicen que si compramos esta torre, tenemos todos los productos de reality preinstalados listos para crear música.
Así como una copia  de cakewalk express 8.
Esta torre tiene un costo de 499 dólares.
Al fin reality para Windows 10!.
Sí, recién en 2022 concideraron revivir a reality casi en toda su gloria, y ahora para nuevos sistemas operativos.
Dicen que les ha costado muchísimo tratar de revivir a este hermoso sintetizador, incluso con su driver de audio de 80 bit.
El código ha sido re escrito para luego  hacerlo valer para nuevos sistemas operativos.
A pesar de estos esfuerzos hay dos cosas a tener en cuenta.
No hay vst todavía para reality!, tocará usar la aplicación normal, y rutear el audio de lo que hagas a reality.
Tampoco ha sido incluido el driver midi que tenía, en su lugar  piden instalar otros parecidos como loopback o midi yoke.
Todo hay que pagar.
Por ahora, nada de esto es gratis, ni siquiera el demo!.
Aquel que quiera entrar a la versión beta y preliminar de reality para Windows 10 tiene que tener en cuenta lo siguiente.
Inscribirte en la versión beta acarrea un costo de 200 dólares, al pagarlos tienes acceso a todas las versiones preliminares que vayan sacando, y el día que aparezca la versión final, que su precio no varia, se queda en 499 dólares, haces el upgrade pagando solo lo que resta de pagar.
También se te brinda la obción de pagar 50 dólares por cada versión beta que saquen del nuevo reality.
Si no puedes pagar los 200 dólares, puedes pagar 50 dolares por cada versión preliminar que vayan sacando, y en caso de no sacar, pagarías 50 dólares al mes hasta comlpetar los 100 para tu versión beta.
Al salir la versión final, sólo pagarías el resto.
Demo pagado!.
Nunca estuvimos de acuerdo que una demo sea pagada, pero ellos aseguran que lo tuvieron que hacer así por el gran desembolso que la empresa hizo en programadoras para revivir sus productos para máquinas modernas.
El que quiera probar la demo, pagaría 50 dólares, y tendría las mismas limitaciones de antes, 20 minutos por seción, y 5 días de uso.
Conclusión.
Aún sigue atrapado en el tiempo reality, con lo mismo que se ha quedado desde su última versión 1.5.7, pero esta vez podemos usarlo en maquinas modernas, y como dije en el titulo de este post, se ha resistido a morir, pero no puede actualizarse mas de lo que está.

martes, 26 de septiembre de 2023

comparte tus creaciones musicales en audio.com

        ¿y si te digo que visites esta página?.
www.audio.com
y no te equivocas, audio punto com, es la competencia real a soundcloud, y lo mejor de todo, ilimitado y gratis!. Audio.com fue creado por muse group, los mismos que  están detrás de muse score, y también quienes compraron los derechos de Audacity.
Es el mejor sitio para compartir tus audios, primero que nada avalado por muse group o sea que hay una empresa seria detrás, y eso te da la seguridad de subir tus podcaswt, música, grabaciones, y otras cosas que quieras compartir solo en audio.
Es completamente gratis!, para siempre!, no existen cargos adicionales, ni características Premium, sin limite de archivos ni de tiempos, audio.com es gratuito para siempre!.
Conección directa con audacity.
Ahora puedes subir tus creaciones hechas en audacity directamente del programa a audio.com y compartirlas con el mundo, pero también es posible subir a la plataforma los proyectos en audacity que incluyen los audios que haz usado.
Hay una buena y una mala noticia.
La mala es que el famoso botón de audio,com en audacity que esta flotando en la pantalla, es todavía inaccesible con lectores de pantalla.
La buena es que la pagina de audio.com es accesible en su totalidad y puedes subir todo desde la pagina rápidamente.
Cómo usarla.
Primero entras a.
www.audio.com
luego te registras ya sea con tu mail y contraseña, o también con google.
Una vez registrados, nos encontramos con un botón grandote que esta al inicio dde la página, upload!.
Este botón upload esta visible en el principio de la página.
Al darle click o enter al botón upload, te lleva a la pagina de carga de archivos.
Ahí se te pedirá subir el contenido que quieras.
Soportan.
Mp3, wav, flak, ogg, y opus, hasta 1 gb por subida.
Pero antes de darle al botón upload, hay otros botones para seleccionar el tipo de audio que quieres compartir, están entre:
Music, podcast, covers, recordings, sound effects,y audio snaps.
Audio snaps es para subir pequeños clips de audio de menos de un minuto.
Y ahora si dale al botón upload.
Espera a que se cargue el archivo, y ahí te aparece la pagina de tu audio subido.
Por el momento esta en bruto pero antes de publicarla del todo dale donde dice edit.
Al darle al botón edit, pones las características del audio que vas a compartir, nombre del audio, creadores, una descripción, asi como las etiquetas para encontrarlo,  toda esta información aparecerá para aquellos ue visiten el enlace para escuchar tu contenido.
Una vez editado ahí te aparecerá la pagina de nuevo con todos los datos llenos, y tu enlace para compartir.
Olvidé mencionar que puedes  hacer que tu audio sea solo escuchado, o que se lo descarguen.
También puedes decidir si tu audio será publico o privado, para que tengan acceso a el solo las personas que compartas tu enlace.
Ya una vez que estes en la pagina de escucha, igual vas a encontrar un botón en el centro que dice play.
El reproductor de audio.com todavía esta por retocar, le faltan los botones de adelantar y retroceder, o los de volumen, pero eso lo arreglarán en versiones que vayan actualizando.
En esa pagina puedes compartir ele enlace, ponerlo en tu Facebook o twitter, o el código para programarlo en tu sitio o blog.
Lee la letra pequeña.
A pesar de que audio.com es gratis e ilimitado, hay cosas que hay que considerar según sus políticas de privacidad,  si eres creador de contenido, no te afectan, pero igual hay que tener en  cuenta.
1: puedes subir cuantos archivos quieras, y que cada archivo pese menos de 1 gb.
2: en el apartado covers, puedes subir covers de canciones mientras esos covers sean creados por ti, o tener la autorización si vas a subir un cover que ha hecho tu amigo, este amigo te autorizará si quieres  subir su cover.
Como dije, sube covers hechos por ti, no subas las canciones originales!, que si encuentran que en tu cuenta has subido tus canciones favoritas cantadas por shaquira o bad bunny, ahí violas uno de sus reglamentos y es posible que tu cuenta sea suspendida.
3: el contenido que audio.com aprecia más es el  original, locual es buenísimo si eres compositor y productor, sube cuantas canciones quieras a la plataforma.
Colecciones.
Audio.com te da la oportunidad de organizar tus audios en colecciones, o sea, puedes crear colecciones de tu música o tus audios, cual si fuera un álbum.
De todo lo que subiste en la plataforma, hay un botoncito que dice add tu collection.
Si aun no has creado una, puedes hacerlo de ahí.
Pon el nombre a tu colección, alguna descripción, y listo.
Curadores de audio.com
Igual que Spotify, audio.com tiene listas de reproducción curadas por expertos, que ellos se encargan de ver el contenido que se ha subido al sitio, analizan si es bueno o malo, y es posible que tu canción sonido o podcast este en el apartado trending, de estar ahí en el apartado trending tu sonido o canción aparecerá en la página principal.
Bueno, ahora si a probarlo!.

viernes, 1 de septiembre de 2023

inteligencia artificial de voz a voz

Hola amigos.

En estos últimos años la inteligencia artificial aplicada al audio va a pasos que realmente asustan.

Desde mejorar tu audio  en post producción, hasta transformar  la voz de una persona en otra voz.

Según se sabe, la tecnología de voz a voz por inteligencia artificial no es nueva.

Sólo que las grandes productoras de Hollywood la han tenido oculta por mucho tiempo.

Desde el 2016 según datos de la página respeecher, sólo lo sabían las grandes empresas como  paramont, fox, pixar, Disney, mgm, entre otras.

Respeecher fue la empresa que trabajo directamente con las grandes industrias del entretenimiento, ofreciéndoles la novedad de la nueva inteligencia artificial de voz a voz.

Su algoritmo ha sido probado en un montón de producciones de estas grandes empresas, ya sea para clonar voces de actores así como traer a la acción voces anónimas que actúan en fiestas, reuniones, y conversaciones al azar sin tener que contratar a gente.

En 2018 respeecher se abrió al público, ofreciendo el mejor conversor de voz a voz en el mercado.

Pero su costosa subscripción hace que sea inaccesible para muchos bolsillos, dando a entender que tienes que tener solvencia económica para poder costearlos.

Se dice que alguien filtró parte del  código de programación que respeecher había ocultado para esta tecnología, y estudiantes de una universidad se aprovecharon de eso para crear el primer entorno de conversión v2v.

Y en 2020 nace dif svc.

El primer sistema de conversión de voz a voz para el público en general.

Pero necesitas tener conocimientos de programación, pithon y google collab para sacarle provecho.

Dif svc  fue muy bueno mientras duró, pero era algo limitado y tenía ciertos problemas.

Entre ellos, que para ser una voz medianamente entrenada, requería como mínimo de 4 horas de audio, menos de eso ya no servía.

La limitante de dif svc era que para entrenar una voz requería como mínimo 4 horas de audio y lo ideal eran 8 horas de audio, el entrenamiento era muy lento, y si usabas google collab necesitas tener collab pro para que no te desconecten o no te quiten la GPU virtual.

Y duró un año dif svc, dejó de recibir soporte y los collabs  desaparecieron del mapa.

En 2022 basado en el viejo dif svc, se crea so vits .

Una versión actualizada y mejorada de dif svc.

La calidad de conversión de voz a voz es mucho mejor.

Se creo un paquete de pre entrenamiento el cual se ha usado hasta 25 horas de audio.

El que desee crear una voz con so vits tiene este beneficio que al empezar a programarlo se puede usar el modelo preentrenado, favoreciendo a los creadores de voces hacer datasets pequeños de hasta menos de una hora, y con un sonido más convincente.

Pero había otro problema por resolver.

Los modelos de voz, no importa si sean hechos con pequeños o grandes datasets, ocupaban 1 giga!, demasiado espacio para un modelo de voz.

Y los que usamos google drive gratuito estaríamos en problemas porque no podemos alojar tantos modelos de voz por los 15 gb que tenemos .

Rvc.

Es basado en las dos tecnologías anteriores pero  cada vez va evolucionando en cosas que podría hacer.

Es más fácil de programar, sus bcollabs son  más intuitivos, si quieres montar esto desde casa con pithon es mucho más fácil de programar.

El modelo preentrenado contiene hasta 50 horas de audio!, esto favorece a aquellos me incluyo, que hacemos pequeños datasets, que suenen muy convincentes, incluso con menos de 10 minutos de audio!.

Un modelo entrenado con rvc consta de dos archivos importantes.

Un archivo de extensión pth, donde esta el modelo listo para usarse sea en inferencia en collab, o con tu entorno en pithon, o cargarlo a paginas donde se comparten modelos de voz.

No importa cuánto lo entrenes, el archivo pth siempre pesara 52 megas!, lo cual es super bueno y no  ocupa mucho y el alma de todo esto es el archivo index, que se crea cuando entrenas una voz, este contiene una lista de audios grabados y actúan junto al modelo pth para dar más realismo, estos archivos index tiene más tamaño porque ahí está todo el audio que ha usado el modelo.

Aun así, puedes hacer un buen modelo en rvc ocupando menos de un giga, o inclusive,  menos de 100 megas!.

Y ahora resulta que los de respeecher están con miedo porque rvc en su versión 2 les está igualando en prestaciones y en calidad.

Si tienes conocimiento de programación, la conversión de voz a voz siempre será gratis para ti.

Pero tienes que saber programar en pithon, y lo más importante tener una tarjeta gráfica decente.

decente.

espacio.

Y con lo costosas que son las GPU hoy en día, a muchos se nos ha ido las esperanzas.

Siempre nos quedan los collabs, que cada vez son más tanto para entrenamiento como para inferencia, con opciones interesantes, y también esto para nosotros es gratis.

Si sabes usar google collab puedes entrenar tu voz y luego hacerle cantar con cualquier archivo de audio o hablando en tiempo real, a mí el collab me va bien me ha gustado mucho y he entrenado varias voces, tanto en so vits como en rvc.

Y google nos presta sus GPU virtuales por tiempo limitado, pero si se acaba el tiempo que hacemos?, nos toca esperar como idiotas desde un día hasta un mes para volver a tener acceso a las GPU.

Ahora, si no quieres comprar una GPU, y te parece difícil usar los collabs, gracias a dios existen páginas que solo subes tu audio, y lo transformas de voz a voz.

Estas son las opciones hasta ahora, agosto 2023.

A respeecher le pondré al final por ser la mejor opción y sigue siendo la  líder.

1: fakeyou.

Empezaron en 2020  como vocodes, y para ese entonces funcionaba y funciona hasta ahora el texto a voz.

Pero a partir de este año fake you ya tiene el servicio de voz a voz.

Usando so vits y rvc v 2, los usuarios que han entrenado voces pueden subir a fake you  sus creaciones, y los que quieran pasar de una voz a otra voz la tiene muy fácil también.

Fake you siempre será generoso en su versión gratuita, ofreciéndote conversiones ilimitadas, pero con tiempo  limitado, la desventaja de la versión gratuita es que toca esperar hasta 30 minutos por una conversión, va bastante lento, y es como una cola, toca esperar tu turno para poder convertir. Pero he visto que en la madrugada no hay mucha afluencia de gente y las colas son más pequeñas.

En fake you en su versión gratuita, su tiempo de conversión es de 2 minutos por archivos, y la mala pega de esperar en la cola.

Puedes usar cualquiera de las subscripciones que fake you ofrece.

Desde 7 dólares al mes, y ahí el tiempo de conversión en voz a voz es de 4 minutos, el plan de 14 dólares al mes duplica a 8 minutos, y el plan de 25 dólares al mes, sin limitaciones de tiempo por archivo.

Uverduk.

Es la competencia directa de fake you, empezaron también en el 2020 y también empezaron con texto a voz.

Este año uverduk también tiene el servicio voz a voz, con un aproximado a 2000 voces disponibles cargadas por la comunidad de usuarios, este número es mayor a los 1600 voces que tiene fakeyou.

Puedes probar esto en uverduk gratuitamente previa registración pero hay más limitaciones que ventajas.

En la versión gratuita tienes.

32 megas de espacio para tus conversiones, es verdad que las conversiones de voz a voz en uverduk gratis no tiene límite de tiempo pero el poco espacio que te dan de 32 megas de almacenamiento, sumado a que puedes hacer 10 previews al mes, y 3 descargas al mes.

Existen planes desde 24 dólares mensuales que ya tu espacio es de 1 giga, 100 previews al mes y 30 descargas al mes, no está nada mal.

Hasta el plan de 300 dólares al mes el cual tienes un espacio ilimitado previews y conversiones ilimitadas también.

Kits.ai

Pienso que es la mejor opción y la más buena en versión gratuita.

Kits.ai fue pensado en principio para tener voces fuera de copyright, voces de artistas emergentes y desconocidos que puedes usarlos gratuitamente, y otras voces de artistas que son Premium, y a diferencia de otros sitios, hablas directamente con los artistas que han clonado su voz, fijas el precio de la licencia, y ellos aceptaran o negaran tu pedido.

De estar como artista, kits.ai si favorece mucho, si clonas tu voz con ellos en modo artista, puedes ganar dinero por eso.

Pero aparte de las voces fuera de copyright y voces nuevas con licencia de artista, tiene un apartado de comunidad donde la gente sube sus modelos creados con rvc y los comparte con el mundo.

No es de exagerar, pero ahora cuentan con 20 mil modelos cargados por la comunidad de usuarios!, sin contar con los 6 modelos gratuitos, y otros 20 modelos Premium que se pueden usar.

Que tiene la versión gratuita de kits?.

1000 conversiones.

Esta buenísimo para ser gratuito!, pero si se te acaban las 1000 conversiones ya tienes que pasarte a un plan Premium que ya es conversiones ilimitadas.

Puedes subir todos los modelos de voz que quieras en la versión gratuita, en especial si fueron creados con algún collab y fuera de la plataforma de kits.

Puedes usar las 6 voces gratuitas y los 3 instrumentos gratuitos y hacer tus proyectos, mientras no sean para uso comercial, lo puedes hacer.

4 minutos de conversión por archivo!, con la versión Premium tienes los mismos 4 minutos no cambia.

Crear tu voz automáticamente dentro de kits sin pasar por un collab!.

A parte de la opción des subir tus modelos de voz, puedes crear tu voz con auto dataset, y de forma gratuita en kits.

La limitación es que si quieres usar esto, solo puedes crear dos voces así, en la versión Premium puedes crear hasta 5 voces.

La parte de la comunidad no está afectada, y siempre será gratuito, tanto para ver los modelos cargados por la comunidad o hacer tus conversiones mientras no pases de las 1000.

Y ahora por 10 dólares mensuales tienes.

Conversiones ilimitadas, crear 5 modelos de voz, usar todo lo de kits para uso comercial, se desbloquean las 20 voces más, hablar con los artistas que han clonado estas voces Premium para negociar un uso comercial que puede ser aceptada o negada.

Contacto directo con los artistas que tiene las voces Premium.

Cuenta de artista.

Cuando  quieras estar  ahí como artista, tendrás que llenar un formulario que el equipo de kits lo revisa.

Una vez que esté aprobado, puedes empezar a clonar tu voz, hasta con 60 minutos de duración, y se te desbloquean las opciones Premium.

voicify.ai

Esta es otra alternativa a kits.ai, pero nada es gratis, y ni siquiera registrándote puedes usarlo, tampoco hay un tryal.

Trabajan bajo la versión mejorada de rvc v2 para las conversiones de voz a voz, la opción de crearte una voz dentro de la plataforma, la opción de subir tu voz  creada en collab, y convertir u una voz en otra.

Voicify trabaja de manera engañosa, diciéndote que el registro es gratis.

Y sí que el registro es gratis.

Durante  la registración te van lavando el coco diciendo que una vez registrado tendrás acceso a lo que ellos ofrecen.

Te hacen preguntas como tu tipo de música, en que quieres usar sus servicios, y mientras te vas registrando te dicen que tienes acceso a 5000 voces cargadas por los usuarios.

E incluso te dicen, ya casi estas listo de disfrutar el mundo de voicify!,  como te van lavando el coco para que te registres.

Y una vez registrado te topas con la cruda realidad, créditos=0.

Durante la registración te han vendido todo un mundo de posibilidades pero nada de lo que te han dicho puedes usar.

Al tener 0 créditos no puedes hacer absolutamente nada, ni probar las voces, ni subir tus modelos, ni siquiera ingresar al apartado de comunidad.

O sea básicamente si puedes pero no puedes hacer ninguna conversión.

Te clavaron un señuelo de publicidad mientras te registrabas para no poder usar nada!.

Así que toca pagar!.

Por 8 dólares al mes tienes 3 conversiones mensuales, 6 previews, subir y compartir un modelo de voz hecho en collab, entrenar tu voz desde la plataforma no está disponible.

Por 24  dólares mensuales tienes 100 conversiones, 100 previews, compartir hasta 10 modelos de voz creadas en collab, usar el entrenamiento interno ya puedes.

Y hay más planes hasta el más caro de 99 al mes, el cual contiene conversiones ilimitadas, previews ilimitadas,  2subir cuantos modelos quieras a la comunidad, 7 voces entrenadas desde la plataforma.

Y si no quieres pagar mensualmente, puedes recurrir a un solo pago de 400 dólares, que contiene todo lo anterior, con la opción de usar todas las voces de la plataforma para uso comercial, así como 10 voces para ser entrenadas.

A breves rasgos diré que eleven labs está trabajando en su tecnología de voz a voz, toca esperar a ver que ofrecen.

Vocalid 6 trae vocalo changer, que puedes usar las voces de vocaloid con tus propias grabaciones de audio.

Voctro labs ofrece un sistema de conversión voz a voz con los cantantes bruno clara y maika, pero estos están para negocios más que para usuarios particulares.

Y ahora para finalizar, hablare de respeecher, el que empezó con todo esto.

Respeecher, ha sido el sitio pionero de conversiones de voz a voz, su algoritmo es único, o mejor dicho era único hasta que se filtró parte del código usado, y si no fuera por ese escape de información no tuviéramos ni dif svc ni siquiera rvc.

Con un catálogo pequeño de unas 300 voces, en las que se juntan voces de personajes famosos así como voces desconocidas para tus proyectos multimedia.

Hasta hace poco respeecher tenía la limitante de subir solo un minuto de audio, ya esto ha sido mejorado y ahora si conversiones ilimitadas.

No sabemos qué modelo usa respeecher, ahora han hermetizado todo eso después de la fuga de información,         lo que sí sabemos es que sus modelos de voz reaccionan a emisiones, cosa que ni rvc ha podido hacerlo!.

Tu modelo no solo puede hablar y cantar, puede reír, aceptar emisiones, y hasta llorar.

Respeecher también ofrece entrenar tu voz desde la plataforma, pero esto   solo se obtiene pagando.

Versión tryal?, claro que sí.

Antes la versión tryal estaba sólo disponible en estados unidos, y consistía en un número 1 800 que te asignaban para que puedas escuchar algunos demos hechos con respeecher.

Este número     sólo duraba 3 días, pero durante esos tres días podías llamar cuando quisieras para escuchar  los demos.

Pero  esto solo estaba disponible dentro de estados unidos.

Pero desde hace poco cambiaron el tryal y ahora si para todo el mundo!.

Ahora puedes usar todo el servicio de respeecher sin límites por 3 dias, no requiere tarjeta de crédito.

No te limitan en nada, es  tal y cual como la vas a tener.

Sin limitaciones por 3 días y luego de los tres días puedes subscribirte a cualquiera de los dos planes que tienen.

Plan básico que tiene un coste de 199  dólares mensuales, con un minuto de  audio por    conversión.

Y el plan de 399 dólares mensuales que tienes conversiones sin límites, clonar tu voz en la plataforma, y muchos beneficios más.