Descripción del trabajo
Se busca un ingeniero de HPC con experiencia para unirse al equipo de verificación de software E2E de infraestructura de HPC/IA.
Se requiere un ingeniero sénior de HPC que sea clave en el hardware y software informático más avanzado para contribuir a los últimos avances en inteligencia artificial y computación en GPU.
La persona aportará conocimientos sobre el diseño de sistemas a escala y los mecanismos de ajuste para ejecuciones de computación a gran escala.
Trabajará con las plataformas de software y hardware de computación acelerada y aprendizaje profundo más recientes, y con numerosos investigadores científicos, desarrolladores y clientes para diseñar flujos de trabajo optimizados y desarrollar nuevas soluciones innovadoras y diferenciadas.
Interactuará con especialistas en HPC, sistemas operativos, computación GPU y sistemas para diseñar, desarrollar e implementar plataformas de alto rendimiento a gran escala.
Responsabilidades:
- Diseño, implementación y mantenimiento de clústeres HPC/IA a gran escala con monitoreo, registro y alertas.
- Administración de programas de trabajos/cargas de trabajo de Linux y herramientas de orquestación.
- Desarrollo y mantenimiento de canales de integración y entrega continuos.
- Desarrollo de herramientas para automatizar la implementación y la gestión de entornos de infraestructura a gran escala, automatizar el monitoreo y las alertas operativas, y permitir el consumo de recursos por autoservicio.
- Implementación de soluciones de monitorización para servidores, red y almacenamiento.
- Solución y reparación de problemas desde el hardware, el sistema operativo, la pila de software y el nivel de aplicación.
- Ser un recurso técnico, desarrollar, redefinir y documentar metodologías estándar para compartir con equipos internos.
- Apoyar las actividades de investigación y desarrollo y participar en POC/POV para mejoras.
Requisitos:
- Licenciatura en Ciencias de la Computación, Ingeniería o campo relacionado o experiencia equivalente.
- Más de 5 años de experiencia.
- Conocimiento de tecnologías de soluciones HPC e IA, desde CPU y GPU hasta interconexiones de alta velocidad y software de soporte.
- Experiencia con cargas de trabajo de programación de trabajos y herramientas de orquestación como Slurm, Kubernetes (K8s).
- Conocimiento de redes (sockets, firewalls, iptables, wireshark, etc.) de Windows y Linux (Redhat/CentOS y Ubuntu) y sus componentes internos, ACL y protección de seguridad a nivel de sistema operativo, y protocolos comunes (TCP, DHCP, DNS, etc.).
- Experiencia con diversas soluciones de almacenamiento, como Lustre, GPFS, ZFS y XFS. Conocimiento de tecnologías de almacenamiento recientes y emergentes.
- Experiencia en programación Python y scripts bash.
- Manejo de herramientas de automatización y gestión de configuración como Jenkins, Ansible, Puppet o Chef.
- Conocimiento profundo de protocolos de red como InfiniBand y Ethernet.
- Conocimiento y experiencia con sistemas virtuales (por ejemplo, VMware, Hyper-V, KVM o Citrix).
- Familiaridad con plataformas de computación en la nube (por ejemplo, AWS, Azure, Google Cloud).
Salario a percibir
Regístrate o identifícate
- Debes estar registrado para solicitar una oferta.
- El tener un perfil completo en Remotojob.com garantiza que tu currículum tendrá mayor exposición.
- Estar registrado nos ayuda a prevenir el spam y los convocantes fantasma.
- Las empresas otorgan mayor credibilidad a los perfiles con descripciones e imágenes completas.
Para ver el contacto directo del empleo, debes tener una cuenta regístrate ahora.




