Pruebas de rendimiento reproducibles

Medir un VPS sin elegir solo la ejecución más rápida

Un benchmark útil responde una pregunta de carga y aporta entorno, comandos, salida bruta y tiempo suficientes para repetirlo. Un resultado aislado no representa todas las aplicaciones ni el rendimiento futuro de infraestructura compartida.

Datos clave

Unidad mínima
Pregunta, entorno, comando, duración, repeticiones, fecha y salida bruta
Regla de comparación
Mismo VPS, imagen, versión y ventana
Resumen honesto
Conservar ejecuciones lentas y fallidas; publicar mediana y variación
Límite de seguridad
Limitar recursos y respetar reglas del proveedor y la red

Empezar con una pregunta de carga

Define qué decisión debe ayudar a tomar. Compilación, API, base transaccional, copia secuencial y archivos multiusuario estresan recursos distintos. Elige un patrón parecido y fija el umbral antes de ver resultados para no promocionar el mayor número.

Especifica plan, región, duración, concurrencia, datos, mezcla, bloque, protocolo, endpoint y ventana. Hosts compartidos y rutas varían: es una muestra fechada, no garantía permanente.

  • Escribe decisión y umbral antes.
  • Prueba una transacción de aplicación cuando puedas.
  • No mezcles métricas inconexas en una nota opaca.

Registrar contexto suficiente

Captura plan, región, hora, imagen, kernel, CPU, memoria, swap, discos, sistema, montaje, IP y versiones. Usa lscpu, free -h, lsblk y uname -r. Elimina secretos e identificadores antes de publicar.

Indica si es nuevo, calentado, redimensionado o con otra carga. Registra inicio y zona horaria. Para red, identifica endpoints, redes, dirección, protocolo y límites. Dos nombres de ciudad no bastan.

  • Fija versiones o guarda metadatos.
  • Mantén el mismo estado del sistema.
  • Publica excepciones en vez de repetir en silencio.

Ejecutar pruebas limitadas

Para CPU usa, por ejemplo, sysbench con hilos y duración. fio modela acceso, cola, bloque, E/S, tamaño y mezcla; guarda JSON con --output-format=json. Dimensiona el archivo y explica la caché.

iperf3 requiere endpoint controlado y límites. Prueba direcciones. ping mide ida y vuelta y pérdida, indicando origen, destino, intervalo, cantidad, familia y ruta. Obtén permiso y detén pruebas intensivas si degradan servicios.

  • Usa un VPS dedicado sin carga cliente.
  • Repite al menos cinco veces.
  • Conserva salida, errores y código final.

Resumir la variabilidad

Revisa errores, throttling, memoria, disco, fondo y saturación. No borres un resultado lento. Si es inválido, consérvalo, explica la exclusión y repite toda la secuencia, no una sustitución oportunista.

Publica mediana y rango o percentil. Disco requiere latencia además de rendimiento; red requiere pérdida y límites. Compara solo configuraciones equivalentes y declara diferencias.

  • Separa inválidos de válidos lentos.
  • Muestra unidades y agregación.
  • Evita porcentajes entre entornos incomparables.

Publicar método, datos y límites juntos

Una prueba creíble enlaza método versionado, manifiesto, comandos, archivos, resumen, fecha y revisor. Usa nombres estables y checksums. Explica que hardware, contención, routing, software o políticas pueden cambiar el resultado.

Repite tras cambios materiales y conserva resultados anteriores con fecha. Mantén correcciones visibles. La plantilla de transparencia de VPSEverywhere.com permanece fuera del índice con ejemplos; solo mediciones reales verificadas deben presentarse como evidencia operativa.

  • Publica ejecuciones fallidas y lentas.
  • Fecha y versiona la metodología.
  • Nunca inventes mediciones retrospectivas.

Fuentes

  1. Documentación de fio
  2. ESnet — Documentación de iperf3
  3. IETF RFC 2681 — Métrica de retardo de ida y vuelta para IPPM
Preguntas frecuentes

Preguntas frecuentes

¿Cuál es el mejor benchmark?

Ninguno es universal. Elige pruebas parecidas a la carga y publica la configuración. Las mediciones de aplicación suelen responder mejor que un único score.

¿Cuántas ejecuciones publicar?

Esta metodología usa al menos cinco idénticas y conserva cada resultado válido. Puede requerir más si hay variación.

¿Por qué mediana y no el máximo?

El máximo premia la selección. La mediana centra observaciones; rango o percentil muestra variación. Ninguno garantiza el futuro.

¿Puedo usar `fio` o `iperf3` en producción?

Evita pruebas disruptivas. Usa entorno dedicado, limita tiempo y tasa, cumple reglas y verifica autorización y capacidad del endpoint.