
Global
494 d
Descripción del trabajo
Se busca un ingeniero de MLOps experto y entusiasta para unirse al equipo de plataforma en crecimiento. Desempeñará un papel fundamental en el desarrollo y mantenimiento de la infraestructura y las herramientas clave que permiten a los ingenieros de aprendizaje automático entrenar, experimentar e implementar modelos de forma eficiente. Esto incluye la creación de soluciones para el acceso a datos, la gestión de recursos de GPU, el seguimiento de experimentos y la optimización del proceso de implementación de modelos.
Responsabilidades:
Diseñar, desarrollar y mantener las herramientas y la infraestructura que respaldan los flujos de trabajo de capacitación, experimentación e implementación de modelos de ML.
Desarrollar sistemas para el acceso y gestión eficiente de grandes conjuntos de datos.
Crear soluciones para optimizar la utilización de la GPU y la asignación de recursos.
Integrar y mantener herramientas de seguimiento y monitoreo de experimentos (por ejemplo, MLflow, TensorBoard).
Desarrollar e implementar los procesos para implementar modelos ML en entornos de producción.
Colaborar con los ingenieros de MLOps para comprender sus necesidades y brindar soluciones efectivas.
Contribuir a mejorar el ciclo de vida de desarrollo de ML y las mejores prácticas.
Solucionar y resolver problemas relacionados con la plataforma.
Mantenerse actualizado con los últimos avances en tecnologías y mejores prácticas de la plataforma.
Requisitos:
De 3 a 4 años de experiencia en un puesto de ingeniería de plataforma ML similar, idealmente con experiencia en la implementación de modelos en producción.
Gran pasión por construir plataformas de ML robustas y escalables.
Comprensión de técnicas de optimización, subprocesos múltiples y conceptos de sistemas distribuidos.
Base en los principios de la informática, incluidas estructuras de datos, algoritmos y análisis de complejidad de algoritmos.
Experiencia en la creación y mantenimiento de sistemas de software, preferiblemente en un entorno de nube (por ejemplo, AWS, GCP, Azure).
Experiencia en la gestión de recursos de GPU, incluida la gestión de controladores, control de acceso, asignación de recursos y gestión de memoria (NVidia, CUDA).
Familiaridad con marcos de aprendizaje automático como TensorFlow o PyTorch.
Experiencia con herramientas de seguimiento de experimentos y gestión de modelos (por ejemplo, MLflow, TensorBoard).
Experiencia con tecnologías de contenedorización (Docker, Kubernetes) y sistemas de control de versiones (por ejemplo, GitHub).
Excelentes habilidades de resolución de problemas, comunicación y colaboración.
Capacidad para trabajar tanto de forma independiente como en equipo.
Conocimiento de enfoques CI/CD, revisiones de código y prácticas de desarrollo colaborativo.
Salario a percibir
Regístrate o identifícate
- Debes estar registrado para solicitar una oferta.
- El tener un perfil completo en Remotojob.com garantiza que tu currículum tendrá mayor exposición.
- Estar registrado nos ayuda a prevenir el spam y los convocantes fantasma.
- Las empresas otorgan mayor credibilidad a los perfiles con descripciones e imágenes completas.
Para ver el contacto directo del empleo, debes tener una cuenta regístrate ahora.



