Logo Talent

HPC Systems Engineer – Security Architecture & Cluster Administration (m/w/d)

Eberhard Karls Universität Tübingen Personalverwaltung Tübingen, Baden Wuerttemberg Vollzeit Heute · Seit heute online

Details zum Jobangebot

Gemeinsam bieten der Exzellenzcluster „Maschinelles Lernen – Neue Perspektiven für die Wissenschaft“ und das Tübingen AI Center folgende Stelle an der Universität Tübingen an: HPC Systems Engineer – Security Architecture & Cluster Administration (m/w/d, E13 TV-L, 100%) Die Stelle ist im Team der Machine Learning Science Cloud angesiedelt und befristet bis zum 31.12.2032.

Über uns Das ML-Cloud-Team stellt die Recheninfrastruktur bereit, die Machine-Learning-Workloads in großem Maßstab ermöglicht – von der Entwicklung über den Betrieb bis zur Sicherheit. Unsere hochmodernen Systeme für das Tübingen AI Center, den Exzellenzcluster „Maschinelles Lernen“ und das Hertie-Institut for AI in Brain Health sind auf vier Rechenzentren verteilt. Da unsere Systeme wachsen und zunehmend sensible Forschungsdaten verarbeiten, wird Sicherheit zu einer zentralen Aufgabe. Wir suchen daher eine:n HPC-Systems-Engineer, der/die technisches Know-how im Cluster-Betrieb mit einem ausgeprägten Sicherheitsdenken vereint. Bei uns gestalten Sie aktiv die Sicherheitsarchitektur einer produktiven HPC-/ML-Umgebung, sorgen für abgesicherte Systeme und bauen die Prozesse und die Infrastruktur auf, welche unsere Forschenden, ihre Daten und ihre Rechenleistung vor der sich derzeit wandelnden Bedrohungslagen schützen.

Ihre

Aufgaben

  • Design und Betrieb unserer HPC-Cluster über vier Rechenzentren hinweg, einschließlich Scheduler (SLURM), paralleler Dateisysteme, Netzwerke und Beschleuniger – mit dem Ziel hoher Verfügbarkeit und hohem Durchsatz für Forschungs-Workloads
  • Konzeption und Aufbau der Sicherheitsarchitektur der Machine Learning Science Cloud sowie Schutz der HPC-Umgebung
  • Weiterentwicklung der automatisierten Bereitstellung und Konfiguration heterogener Compute-, Storage- und Netzwerk-Knoten (z. B. imagebasierte Provisionierung, Node-Lifecycle)
  • Patch- und Schwachstellenmanagement sowie Risikobewertung über unterschiedliche Systeme hinweg
  • Aufbau und Betrieb von Logging, Monitoring und Erkennung unbefugter Zugriffe sowie Integration von HPC-Telemetriedaten in operative Dashboards und Incident-Response-Workflows
  • Leitung des Incident Response für die Cluster: Erkennung, Eindämmung, forensische Nachbereitung von Vorfällen
  • Automatisierung von Betrieb und Sicherheitsrichtlinien “as Code” (Ansible/IaC)
  • Beratung von Forschenden zur effizienten, sicheren Cluster-Nutzung (Job-Scheduling, Datenhandhabung, Zugriffs-Workflows) sowie Ableitung von Anforderungen für unsere weitere Roadmap aus ihren wissenschaftlichen Workloads

Ihr

Profil

  • Master-Abschluss in Informatik oder einem verwandten Fachgebiet
  • Fundierte IT-Sicherheitskenntnisse: Systemschutz, Netzwerksicherheit, angewandte Kryptographie und IAM – mit der Fähigkeit, architektonische Entscheidungen aus einem Bedrohungsmodell abzuleiten und nicht nur vorgegebene Baselines anzuwenden
  • Solide Linux-Erfahrung in Produktivumgebungen (RHEL/AlmaLinux/Ubuntu)
  • Praktische HPC-Erfahrung: Slurm, parallele Dateisysteme (Weka, Lustre, Ceph), GPU-Workloads und Hochgeschwindigkeitsnetzwerke (InfiniBand, 400G Ethernet)
  • Erfahrung mit Virtualisierung für Management-Plane und Infrastrukturdienste (Proxmox)
  • Starke Skripting- und Automatisierungskenntnisse (Bash, Python, Ansible) sowie Erfahrung mit Konfigurationsmanagement / “Infrastructure-as-Code"
  • Von Vorteil: Sicherheits-Frameworks (ISO 27001, BSI-Grundschutz), Container-Sicherheit (Apptainer/Singularity/Docker) oder Grundlagen der Offensive Security
  • Selbstständige, strukturierte Arbeitsweise und gute Kommunikationsfähigkeiten in Englisch; Deutschkenntnisse von Vorteil
  • Kollaborative, nutzerorientierte Denkweise – Freude daran, Forschende zu unterstützen und zu beraten sowie deren Bedürfnisse in HPC-Plattformdesign abzubilden
  • Was wir bieten
  • Technisch anspruchsvolle, inhaltlich offene Arbeit zur Ermöglichung von Spitzenforschung im Bereich Machine Learning
  • Flexible Arbeitszeiten und die Möglichkeit, teilweise im Homeoffice zu arbeiten
  • Arbeit in einem englischsprachigen, internationalen Team von HPC-Expert:innen
  • Ein kleines, erfahrenes Team mit flachen Hierarchien, in dem Verantwortung nach Themen aufgeteilt ist
  • Verantwortung für einen technischen Bereich innerhalb des Teams
  • Fortbildungsmöglichkeiten, Konferenzteilnahmen und Einfluss auf unsere Entwicklungsperspektiven
  • Interesse? Wir freuen uns auf Ihre Bewerbung! Bitte reichen Sie Ihre Bewerbungsunterlagen auf Englisch, einschließlich Lebenslauf und relevanter Zeugnisse, bis zum 20.09.2026 über unser Bewerbungsportal careers.tuebingen.ai ein. Bei Fragen wenden Sie sich bitte an Simon Kreuzer unter