Nvidia publicó TensorRT-LLM v1.3.0rc25 el 31 de agosto a las 03:24:43 UTC. El cambio de mayor alcance es que KV cache manager V2 pasó a ser el valor predeterminado para unas 21 familias de modelos. La versión está marcada como prerelease, que es el dato atenuante aquí, pero las notas siguen en abierta contradicción consigo mismas.

Una afirmación sin datos que la respalden

La justificación ofrecida para convertir V2 en predeterminado es una mejor escalabilidad y estabilidad. No hay una línea de base, ni un benchmark, ni una cifra de rendimiento, ni una comparación del consumo de memoria, ni una carga de trabajo concreta. Para un componente que decide cómo se asigna la caché de atención en una flota de servicio, decir "más estable" sin una medición no es una afirmación de ingeniería sobre la que un operador pueda actuar.

La misma página lo contradice

Las notas de la versión incluyen una sección de problemas conocidos, y KV cache manager V2 aparece en ella repetidamente, incluida una nota de que el programador V2 podría fallar de forma intermitente o quedarse sin memoria en B200, el actual buque insignia de Nvidia. Así pues, el componente promocionado como predeterminado por razones de estabilidad figura, en la misma página, como capaz de fallar en el hardware más reciente y con más probabilidades de ejecutarlo. Ambas afirmaciones pueden ser ciertas —V2 podría ser mejor en conjunto y aun así tener un error abierto en el programador—, pero las notas nunca las reconcilian, y quien se queda solo con los destacados ve únicamente la primera.

Qué falla en el encuadre habitual

Los resúmenes de notas de versión tratan "predeterminado" como una señal de madurez: si el proveedor lo activó, debe de estar listo. En canales de prerelease esa inferencia no se sostiene. Poner algo por defecto es la forma en que un proyecto obtiene cobertura de pruebas, y las compilaciones etiquetadas como rc son precisamente el lugar donde eso se supone que ocurre. El error consiste en leer un valor predeterminado de release candidate como una recomendación para producción, y la lectura honesta de esta versión es que Nvidia está ampliando la exposición a V2 precisamente porque todavía tiene problemas abiertos.

Qué debería hacer un operador

Lea los problemas conocidos antes que los destacados, y fije el gestor de KV cache anterior si está prestando servicio en B200 hasta que se aclaren las notas del programador. La vía de escape existe; simplemente la versión no la presenta de entrada como algo que quizá convenga usar.