A startup francesa ZML lançou o ZML/LLMD, um servidor de inferência para grandes modelos de linguagem em versão alpha. A ferramenta é apresentada pela empresa como um servidor universal para LLMs e tem como proposta acelerar a execução desses modelos em diferentes chips de inteligência artificial.
A inferência é a etapa em que um modelo já treinado processa entradas e gera respostas, uma parte central do custo operacional de aplicações de IA. Ao mirar a execução em múltiplos tipos de hardware, o ZML/LLMD busca reduzir a dependência de configurações específicas e facilitar a operação de modelos em ambientes variados.
Segundo as informações divulgadas pela empresa, o lançamento ainda está em fase alpha, o que indica um estágio inicial de disponibilização. A proposta da ZML se insere na disputa por infraestrutura de IA mais eficiente, em um momento em que empresas procuram diminuir custos e melhorar o desempenho de serviços baseados em modelos de linguagem.


