Hola amigos.
En estos últimos años la
inteligencia artificial aplicada al audio va a pasos que realmente asustan.
Desde mejorar tu audio en
post producción, hasta transformar la voz de una persona en otra voz.
Según se sabe, la tecnología de
voz a voz por inteligencia artificial no es nueva.
Sólo que las grandes productoras
de Hollywood la han tenido oculta por mucho tiempo.
Desde el 2016 según datos de la
página respeecher, sólo lo sabían las grandes empresas como paramont,
fox, pixar, Disney, mgm, entre otras.
Respeecher fue la empresa que
trabajo directamente con las grandes industrias del entretenimiento,
ofreciéndoles la novedad de la nueva inteligencia artificial de voz a voz.
Su algoritmo ha sido probado en
un montón de producciones de estas grandes empresas, ya sea para clonar voces
de actores así como traer a la acción voces anónimas que actúan en fiestas,
reuniones, y conversaciones al azar sin tener que contratar a gente.
En 2018 respeecher se abrió al
público, ofreciendo el mejor conversor de voz a voz en el mercado.
Pero su costosa subscripción hace
que sea inaccesible para muchos bolsillos, dando a entender que tienes que
tener solvencia económica para poder costearlos.
Se dice que alguien filtró parte
del código de programación que respeecher había ocultado para esta tecnología,
y estudiantes de una universidad se aprovecharon de eso para crear el primer
entorno de conversión v2v.
Y en 2020 nace dif svc.
El primer sistema de conversión
de voz a voz para el público en general.
Pero necesitas tener
conocimientos de programación, pithon y google collab para sacarle provecho.
Dif svc fue muy bueno
mientras duró, pero era algo limitado y tenía ciertos problemas.
Entre ellos, que para ser una voz
medianamente entrenada, requería como mínimo de 4 horas de audio, menos de eso
ya no servía.
La limitante de dif svc era que
para entrenar una voz requería como mínimo 4 horas de audio y lo ideal eran 8
horas de audio, el entrenamiento era muy lento, y si usabas google collab
necesitas tener collab pro para que no te desconecten o no te quiten la GPU
virtual.
Y duró un año dif svc, dejó de
recibir soporte y los collabs desaparecieron del mapa.
En 2022 basado en el viejo dif
svc, se crea so vits .
Una versión actualizada y
mejorada de dif svc.
La calidad de conversión de voz a
voz es mucho mejor.
Se creo un paquete de pre
entrenamiento el cual se ha usado hasta 25 horas de audio.
El que desee crear una voz con so
vits tiene este beneficio que al empezar a programarlo se puede usar el modelo
preentrenado, favoreciendo a los creadores de voces hacer datasets pequeños de
hasta menos de una hora, y con un sonido más convincente.
Pero había otro problema por
resolver.
Los modelos de voz, no importa si
sean hechos con pequeños o grandes datasets, ocupaban 1 giga!, demasiado
espacio para un modelo de voz.
Y los que usamos google drive
gratuito estaríamos en problemas porque no podemos alojar tantos modelos de voz
por los 15 gb que tenemos .
Rvc.
Es basado en las dos tecnologías
anteriores pero cada vez va evolucionando en cosas que podría hacer.
Es más fácil de programar, sus
bcollabs son más intuitivos, si quieres montar esto desde casa con pithon
es mucho más fácil de programar.
El modelo preentrenado contiene
hasta 50 horas de audio!, esto favorece a aquellos me incluyo, que hacemos
pequeños datasets, que suenen muy convincentes, incluso con menos de 10 minutos
de audio!.
Un modelo entrenado con rvc
consta de dos archivos importantes.
Un archivo de extensión pth,
donde esta el modelo listo para usarse sea en inferencia en collab, o con tu
entorno en pithon, o cargarlo a paginas donde se comparten modelos de voz.
No importa cuánto lo entrenes, el
archivo pth siempre pesara 52 megas!, lo cual es super bueno y no ocupa
mucho y el alma de todo esto es el archivo index, que se crea cuando entrenas
una voz, este contiene una lista de audios grabados y actúan junto al modelo
pth para dar más realismo, estos archivos index tiene más tamaño porque ahí está
todo el audio que ha usado el modelo.
Aun así, puedes hacer un buen
modelo en rvc ocupando menos de un giga, o inclusive, menos de 100
megas!.
Y ahora resulta que los de
respeecher están con miedo porque rvc en su versión 2 les está igualando en
prestaciones y en calidad.
Si tienes conocimiento de
programación, la conversión de voz a voz siempre será gratis para ti.
Pero tienes que saber programar
en pithon, y lo más importante tener una tarjeta gráfica decente.
decente.
espacio.
Y con lo costosas que son las GPU
hoy en día, a muchos se nos ha ido las esperanzas.
Siempre nos quedan los collabs,
que cada vez son más tanto para entrenamiento como para inferencia, con opciones
interesantes, y también esto para nosotros es gratis.
Si sabes usar google collab
puedes entrenar tu voz y luego hacerle cantar con cualquier archivo de audio o
hablando en tiempo real, a mí el collab me va bien me ha gustado mucho y he
entrenado varias voces, tanto en so vits como en rvc.
Y google nos presta sus GPU
virtuales por tiempo limitado, pero si se acaba el tiempo que hacemos?, nos
toca esperar como idiotas desde un día hasta un mes para volver a tener acceso
a las GPU.
Ahora, si no quieres comprar una
GPU, y te parece difícil usar los collabs, gracias a dios existen páginas que
solo subes tu audio, y lo transformas de voz a voz.
Estas son las opciones hasta
ahora, agosto 2023.
A respeecher le pondré al final
por ser la mejor opción y sigue siendo la líder.
1: fakeyou.
Empezaron en 2020 como
vocodes, y para ese entonces funcionaba y funciona hasta ahora el texto a voz.
Pero a partir de este año fake
you ya tiene el servicio de voz a voz.
Usando so vits y rvc v 2, los
usuarios que han entrenado voces pueden subir a fake you sus creaciones,
y los que quieran pasar de una voz a otra voz la tiene muy fácil también.
Fake you siempre será generoso en
su versión gratuita, ofreciéndote conversiones ilimitadas, pero con tiempo
limitado, la desventaja de la versión gratuita es que toca esperar hasta
30 minutos por una conversión, va bastante lento, y es como una cola, toca
esperar tu turno para poder convertir. Pero he visto que en la madrugada no hay
mucha afluencia de gente y las colas son más pequeñas.
En fake you en su versión
gratuita, su tiempo de conversión es de 2 minutos por archivos, y la mala pega
de esperar en la cola.
Puedes usar cualquiera de las
subscripciones que fake you ofrece.
Desde 7 dólares al mes, y ahí el
tiempo de conversión en voz a voz es de 4 minutos, el plan de 14 dólares al mes
duplica a 8 minutos, y el plan de 25 dólares al mes, sin limitaciones de tiempo
por archivo.
Uverduk.
Es la competencia directa de fake
you, empezaron también en el 2020 y también empezaron con texto a voz.
Este año uverduk también tiene el
servicio voz a voz, con un aproximado a 2000 voces disponibles cargadas por la
comunidad de usuarios, este número es mayor a los 1600 voces que tiene fakeyou.
Puedes probar esto en uverduk
gratuitamente previa registración pero hay más limitaciones que ventajas.
En la versión gratuita tienes.
32 megas de espacio para tus
conversiones, es verdad que las conversiones de voz a voz en uverduk gratis no
tiene límite de tiempo pero el poco espacio que te dan de 32 megas de
almacenamiento, sumado a que puedes hacer 10 previews al mes, y 3 descargas al
mes.
Existen planes desde 24 dólares
mensuales que ya tu espacio es de 1 giga, 100 previews al mes y 30 descargas al
mes, no está nada mal.
Hasta el plan de 300 dólares al
mes el cual tienes un espacio ilimitado previews y conversiones ilimitadas
también.
Kits.ai
Pienso que es la mejor opción y
la más buena en versión gratuita.
Kits.ai fue pensado en principio
para tener voces fuera de copyright, voces de artistas emergentes y
desconocidos que puedes usarlos gratuitamente, y otras voces de artistas que
son Premium, y a diferencia de otros sitios, hablas directamente con los artistas
que han clonado su voz, fijas el precio de la licencia, y ellos aceptaran o
negaran tu pedido.
De estar como artista, kits.ai si
favorece mucho, si clonas tu voz con ellos en modo artista, puedes ganar dinero
por eso.
Pero aparte de las voces fuera de
copyright y voces nuevas con licencia de artista, tiene un apartado de
comunidad donde la gente sube sus modelos creados con rvc y los comparte con el
mundo.
No es de exagerar, pero ahora
cuentan con 20 mil modelos cargados por la comunidad de usuarios!, sin contar
con los 6 modelos gratuitos, y otros 20 modelos Premium que se pueden usar.
Que tiene la versión gratuita de
kits?.
1000 conversiones.
Esta buenísimo para ser
gratuito!, pero si se te acaban las 1000 conversiones ya tienes que pasarte a
un plan Premium que ya es conversiones ilimitadas.
Puedes subir todos los modelos de
voz que quieras en la versión gratuita, en especial si fueron creados con algún
collab y fuera de la plataforma de kits.
Puedes usar las 6 voces gratuitas
y los 3 instrumentos gratuitos y hacer tus proyectos, mientras no sean para uso
comercial, lo puedes hacer.
4 minutos de conversión por
archivo!, con la versión Premium tienes los mismos 4 minutos no cambia.
Crear tu voz automáticamente
dentro de kits sin pasar por un collab!.
A parte de la opción des subir
tus modelos de voz, puedes crear tu voz con auto dataset, y de forma gratuita
en kits.
La limitación es que si quieres
usar esto, solo puedes crear dos voces así, en la versión Premium puedes crear
hasta 5 voces.
La parte de la comunidad no está
afectada, y siempre será gratuito, tanto para ver los modelos cargados por la
comunidad o hacer tus conversiones mientras no pases de las 1000.
Y ahora por 10 dólares mensuales
tienes.
Conversiones ilimitadas, crear 5
modelos de voz, usar todo lo de kits para uso comercial, se desbloquean las 20
voces más, hablar con los artistas que han clonado estas voces Premium para
negociar un uso comercial que puede ser aceptada o negada.
Contacto directo con los artistas
que tiene las voces Premium.
Cuenta de artista.
Cuando quieras estar
ahí como artista, tendrás que llenar un formulario que el equipo de kits
lo revisa.
Una vez que esté aprobado, puedes
empezar a clonar tu voz, hasta con 60 minutos de duración, y se te desbloquean
las opciones Premium.
voicify.ai
Esta es otra alternativa a
kits.ai, pero nada es gratis, y ni siquiera registrándote puedes usarlo,
tampoco hay un tryal.
Trabajan bajo la versión mejorada
de rvc v2 para las conversiones de voz a voz, la opción de crearte una voz
dentro de la plataforma, la opción de subir tu voz creada en collab, y
convertir u una voz en otra.
Voicify trabaja de manera
engañosa, diciéndote que el registro es gratis.
Y sí que el registro es gratis.
Durante la registración te
van lavando el coco diciendo que una vez registrado tendrás acceso a lo que
ellos ofrecen.
Te hacen preguntas como tu tipo
de música, en que quieres usar sus servicios, y mientras te vas registrando te
dicen que tienes acceso a 5000 voces cargadas por los usuarios.
E incluso te dicen, ya casi estas
listo de disfrutar el mundo de voicify!, como te van lavando el coco para
que te registres.
Y una vez registrado te topas con
la cruda realidad, créditos=0.
Durante la registración te han
vendido todo un mundo de posibilidades pero nada de lo que te han dicho puedes
usar.
Al tener 0 créditos no puedes
hacer absolutamente nada, ni probar las voces, ni subir tus modelos, ni
siquiera ingresar al apartado de comunidad.
O sea básicamente si puedes pero
no puedes hacer ninguna conversión.
Te clavaron un señuelo de
publicidad mientras te registrabas para no poder usar nada!.
Así que toca pagar!.
Por 8 dólares al mes tienes 3 conversiones
mensuales, 6 previews, subir y compartir un modelo de voz hecho en collab,
entrenar tu voz desde la plataforma no está disponible.
Por 24 dólares mensuales
tienes 100 conversiones, 100 previews, compartir hasta 10 modelos de voz
creadas en collab, usar el entrenamiento interno ya puedes.
Y hay más planes hasta el más
caro de 99 al mes, el cual contiene conversiones ilimitadas, previews
ilimitadas, 2subir cuantos modelos quieras a la comunidad, 7 voces
entrenadas desde la plataforma.
Y si no quieres pagar
mensualmente, puedes recurrir a un solo pago de 400 dólares, que contiene todo
lo anterior, con la opción de usar todas las voces de la plataforma para uso
comercial, así como 10 voces para ser entrenadas.
A breves rasgos diré que eleven
labs está trabajando en su tecnología de voz a voz, toca esperar a ver que
ofrecen.
Vocalid 6 trae vocalo changer,
que puedes usar las voces de vocaloid con tus propias grabaciones de audio.
Voctro labs ofrece un sistema de
conversión voz a voz con los cantantes bruno clara y maika, pero estos están
para negocios más que para usuarios particulares.
Y ahora para finalizar, hablare
de respeecher, el que empezó con todo esto.
Respeecher, ha sido el sitio
pionero de conversiones de voz a voz, su algoritmo es único, o mejor dicho era
único hasta que se filtró parte del código usado, y si no fuera por ese escape
de información no tuviéramos ni dif svc ni siquiera rvc.
Con un catálogo pequeño de unas
300 voces, en las que se juntan voces de personajes famosos así como voces
desconocidas para tus proyectos multimedia.
Hasta hace poco respeecher tenía
la limitante de subir solo un minuto de audio, ya esto ha sido mejorado y ahora
si conversiones ilimitadas.
No sabemos qué modelo usa
respeecher, ahora han hermetizado todo eso después de la fuga de
información, lo que sí sabemos
es que sus modelos de voz reaccionan a emisiones, cosa que ni rvc ha podido
hacerlo!.
Tu modelo no solo puede hablar y
cantar, puede reír, aceptar emisiones, y hasta llorar.
Respeecher también ofrece
entrenar tu voz desde la plataforma, pero esto solo se obtiene
pagando.
Versión tryal?, claro que sí.
Antes la versión tryal estaba
sólo disponible en estados unidos, y consistía en un número 1 800 que te
asignaban para que puedas escuchar algunos demos hechos con respeecher.
Este número
sólo duraba 3 días, pero durante esos tres días podías llamar cuando quisieras
para escuchar los demos.
Pero esto solo estaba
disponible dentro de estados unidos.
Pero desde hace poco cambiaron el
tryal y ahora si para todo el mundo!.
Ahora puedes usar todo el
servicio de respeecher sin límites por 3 dias, no requiere tarjeta de crédito.
No te limitan en nada, es
tal y cual como la vas a tener.
Sin limitaciones por 3 días y
luego de los tres días puedes subscribirte a cualquiera de los dos planes que
tienen.
Plan básico que tiene un coste de
199 dólares mensuales, con un minuto de audio por
conversión.
Y el plan de 399 dólares
mensuales que tienes conversiones sin límites, clonar tu voz en la plataforma,
y muchos beneficios más.