Cómputo científico · 2012–14

Infraestructura crítica para la misión en dos de los programas científicos más exigentes del mundo.

Mantener el cómputo científico crítico para la misión funcionando al ritmo que exige la ciencia, a lo largo de programas que duran décadas.

El reto

Dos de los programas científicos más exigentes del mundo dependen de los datos que los sustentan. En el CERN, el Gran Colisionador de Hadrones genera datos brutos de colisiones del orden de un petabyte por segundo en sus cuatro experimentos principales con luminosidad máxima; los disparadores de hardware y software descartan ~99,99% en tiempo real, dejando aproximadamente 1 PB/día escrito en almacenamiento permanente y ~90 PB/año añadidos a un archivo en cinta que hoy suma alrededor de un exabyte. La nave espacial GAIA de la Agencia Espacial Europea está cartografiando la posición, el movimiento y las propiedades de más de mil millones de estrellas. Ambos programas requieren una infraestructura de datos que sencillamente no puede fallar. Una interrupción del pipeline no es un ticket de servicio; es ciencia perdida. La capacidad debe planearse para misiones que se prolongan por una década o más.

Restricciones

  • Ciclos de vida de misión medidos en décadas, no en trimestres
  • Parque de cómputo heterogéneo: servidores Linux y Windows en cargas de trabajo científicas
  • Infraestructura de red segura para comunicaciones de investigación: firewalls, switches, VoIP
  • Operación dentro de los estándares de cómputo científico del gobierno del Reino Unido (STFC, Royal Observatory Edinburgh)
  • Planeación de capacidad bajo incertidumbre: la demanda científica crece de formas en que la demanda empresarial no lo hace

Nuestro enfoque

Tratar la infraestructura como un activo de ciclo de vida prolongado.

El cómputo científico premia la infraestructura diseñada para horizontes de diez y veinte años. Abordamos el cómputo, el almacenamiento y la red como activos de ciclo de vida prolongado, con cadencias claras de renovación de hardware, márgenes de capacidad y documentación operativa que sobreviviría a varias generaciones de personal.

Diseñar para la demanda conocida y la desconocida.

Algunas cargas de trabajo (análisis del LHC, procesamiento de la misión GAIA) tenían formas predecibles. Otras surgirían a medida que los científicos encontraran nuevas preguntas que plantear. Dimensionamos para ambas: aprovisionamiento determinista para lo conocido, holgura y elasticidad para lo desconocido.

Operar con confiabilidad de grado científico.

El cómputo científico crítico para la misión no recibe una ventana de mantenimiento durante una corrida del LHC. Diseñamos para operaciones en sitio, tolerancia a fallas parciales y recuperación rápida. Cada cambio se revisaba contra el calendario de la misión.

Documentar para la longevidad de la misión.

La documentación de configuración, los procedimientos operativos y las líneas base de capacidad se trataron como entregables, no como subproductos. El siguiente ingeniero que cruzara la puerta, dentro de cinco o diez años, necesitaba heredar un sistema operable.

Lo que entregamos

  • Diseñamos y operamos más de 20 servidores Linux y Windows críticos para la misión en el Royal Observatory Edinburgh
  • Mantuvimos infraestructura de red segura, incluidos firewalls, switches y VoIP para comunicaciones de investigación
  • Planeación de capacidad y gestión de ciclo de vida para hardware de cómputo y almacenamiento científico
  • Procedimientos operativos y documentación de configuración para una transición de ciclo de vida prolongado
  • Validación de recuperación ante desastres y continuidad del negocio en cargas de trabajo científicas

Resultado

Pipelines de datos confiables alimentaron dos de los programas científicos más exigentes de la Tierra: el análisis de física de partículas del CERN y el censo estelar GAIA de la ESA. La infraestructura funcionó al ritmo que exigía la ciencia, no al ritmo que adopta por defecto la TI empresarial. El trabajo dio forma a cómo Avila Systems aborda desde entonces cada proyecto crítico para la misión: diseñar para el ciclo de vida razonable más largo, documentar para el siguiente ingeniero y tratar la confiabilidad como un instrumento científico, no como un acuerdo de nivel de servicio.

Tecnología

Linux Windows Server Gestión de ciclo de vida de hardware Infraestructura de firewall y switches VoIP

Cumplimiento

Estándares de cómputo científico del STFC Estándares operativos del Royal Observatory Edinburgh
Hagámoslo bien desde la ingeniería

¿Tienes una plataforma que debe resistir bajo presión?

Cuéntanos sobre el entorno en el que operas. Pondremos a los ingenieros senior que pueden diseñarlo, asegurarlo y operarlo contigo.