A Fish Audio anunciou uma rodada seed de US$ 52 milhões para expandir o desenvolvimento de modelos de voz com inteligência artificial voltados a criadores e clientes corporativos. Sediada em Palo Alto, a empresa afirma que já soma mais de 8 milhões de usuários entre versões open source e hospedadas de seus modelos e gera receita recorrente anual de US$ 21 milhões. O aporte foi liderado por Coreline Ventures e Capital Today, com participação de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners e HF0.
A startup surgiu a partir de um projeto do pesquisador Shijia Liao, ex-Nvidia, que treinou um modelo de geração de voz em uma única GPU e depois o disponibilizou em código aberto. Desde então, a empresa lançou cinco modelos no período de um ano, sendo quatro de geração de fala e um de transcrição. Três desses modelos de voz foram abertos, enquanto o modelo mais recente, S2.1 Pro, está disponível apenas por meio de uma API paga.
A Fish Audio oferece planos pagos mensais para criadores e equipes, com franquia de minutos de geração e recursos de clonagem de voz, além de uma oferta empresarial para uso de APIs e da plataforma. Segundo a empresa, organizações como HeyGen e Sanas já utilizam a tecnologia. A companhia também disse ter automatizado seu processo de remoção de vozes após relatos de uso sem consentimento, permitindo que criadores enviem uma amostra curta de voz ou contrato para comprovar titularidade e solicitar a retirada em menos de três minutos.


