A Nvidia publicou o TensorRT-LLM v1.3.0rc25 em 31 de agosto às 03:24:43 UTC. A mudança de maior alcance é que o KV cache manager V2 passou a ser o padrão para cerca de 21 famílias de modelos. A versão é marcada como pré-lançamento, o que é o fator atenuante aqui — mas as notas continuam em conflito consigo mesmas.

Uma afirmação sem número por trás

A justificativa dada para tornar o V2 padrão é melhor escalabilidade e estabilidade. Não há linha de base, benchmark, métrica de throughput, comparação de uso de memória nem carga de trabalho nomeada. Para um componente que decide como o cache de atenção é alocado em uma frota de serving, "mais estável" sem uma medição não é uma afirmação de engenharia com a qual um operador possa agir.

A mesma página a contradiz

As notas de versão trazem uma seção de Problemas Conhecidos, e o KV cache manager V2 aparece nela repetidamente — incluindo uma observação de que o scheduler do V2 pode travar intermitentemente ou ficar sem memória no B200, o atual carro-chefe da Nvidia. Assim, o componente promovido a padrão por razões de estabilidade é, na mesma página, documentado como capaz de travar no hardware mais recente e com maior probabilidade de executá-lo. As duas afirmações podem ser verdadeiras — o V2 pode ser melhor no agregado e ainda assim ter um bug aberto no scheduler —, mas as notas nunca reconciliam isso, e quem para nos destaques vê apenas a primeira.

O que a leitura comum interpreta errado

Os resumos de notas de versão tratam "padrão" como um sinal de maturidade: se o fornecedor ativou, deve estar pronto. Em canais de pré-lançamento, essa inferência não se sustenta. Tornar padrão é como um projeto obtém cobertura de testes, e é para isso que builds com tag rc servem. O erro é ler um padrão de release candidate como recomendação para produção — e a leitura honesta desta é que a Nvidia está ampliando a exposição ao V2 precisamente porque ele ainda tem problemas em aberto.

O que um operador deve fazer

Leia os Problemas Conhecidos antes dos destaques e fixe o gerenciador anterior de KV cache se estiver operando em B200 até que as observações sobre o scheduler sejam resolvidas. A saída existe; a versão simplesmente não destaca isso logo de início.