<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <link rel="alternate" type="text/html" href="https://betriebsstatus.tu-dresden.de/"/>
    <title>System_hpc_job_monitoring_name on TU_dresden_title</title>
    <link>https://betriebsstatus.tu-dresden.de/affected/system_hpc_job_monitoring_name/</link>
    <description>Vorfallshistorie</description>
    <generator>github.com/cstate</generator>
    <language>de</language>
    
    <lastBuildDate>2026-07-29T09:00:00+02:00</lastBuildDate>
    <updated>2026-07-29T09:00:00+02:00</updated>
    
    
    
      <atom:link href="https://betriebsstatus.tu-dresden.de/affected/system_hpc_job_monitoring_name/index.xml" rel="self" type="application/rss+xml" />
    
    
      <item>
        <title>Wartung: HPC-Filesystem, 29.07.2026, 09:00 - 13:00 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-07-29-wartung_hpc-filesystem_29-07-2026_09_00_-_13_00_uhr/</link>
        <pubDate>Wed, 29 Jul 2026 09:00:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-07-29-wartung_hpc-filesystem_29-07-2026_09_00_-_13_00_uhr/</guid>
        <category>2026-07-29T13:00:00.000&#43;02:00</category>
        <description>&lt;p&gt;Das Scratch-Dateisystem /data/horse wird erweitert, um den Zugriff auf kleine Dateien zu beschleunigen. Zu diesem Zweck werden alle Cluster am Mittwoch (29. Juli) zwischen 9:00 und ca. 13:00 Uhr für eine kurze Wartung offline geschaltet.&lt;/p&gt;
&lt;p&gt;Während der gesamten Zeit ist keine Datenübertragung zu/von /data/horse möglich&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Das Scratch-Dateisystem /data/horse wird erweitert, um den Zugriff auf kleine Dateien zu beschleunigen. Zu diesem Zweck werden alle Cluster am Mittwoch (29. Juli) zwischen 9:00 und ca. 13:00 Uhr für eine kurze Wartung offline geschaltet.&lt;/p&gt;
&lt;p&gt;Während der gesamten Zeit ist keine Datenübertragung zu/von /data/horse möglich&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>Wartung/Downtime: HPC, 04.05.26, 17 Uhr - 06.05.26, 12 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-05-04-wartung_downtime_hpc_04-05-26_17_uhr_-_06-05-26_12_uhr/</link>
        <pubDate>Mon, 04 May 2026 17:00:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-05-04-wartung_downtime_hpc_04-05-26_17_uhr_-_06-05-26_12_uhr/</guid>
        <category>2026-05-06T12:00:00.000&#43;02:00</category>
        <description>&lt;p&gt;DDN und Bull werden eine Dateisystemprüfung unter /data/horse durchführen, um beschädigte Dateien zu identifizieren und zu reparieren. Zu diesem Zweck werden alle HPC-Cluster (einschließlich Login-Knoten, Data Movers und Data Ports) heruntergefahren. Während dieser Zeit ist kein Zugriff auf Daten in den HPC-Dateisystemen möglich:&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Beginn der Ausfallzeit: 4. Mai 2026, 17:00 Uhr 
Voraussichtliches Ende der Ausfallzeit: 6. Mai 2026, 12:00 Uhr
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;Um diese Ausfallzeit optimal zu nutzen, werden Bull, DDN und ZIH außerdem zusätzliche globale Wartungsarbeiten durchführen, wie z. B. Änderungen am Netzwerk und an den NFS-Dateisystemen sowie verschiedene Updates.
Sollten die Arbeiten an /data/horse deutlich länger dauern als die anderen Wartungsaufgaben, werden die Cluster Capella, Alpha Centauri und Romeo neu gestartet. Diese Cluster verfügen über alternative Scratch-Dateisysteme (/data/cat und /data/quokka), sodass Jobs dort ausgeführt werden können. Allerdings können nur Jobs mit dem entsprechenden Flag für das erforderliche Dateisystem (-L cat oder -L quokka) gestartet werden [1]. (Tipp: Sie sollten die Flags für die erforderlichen Dateisysteme am besten schon heute in Ihre Skripte einbauen.)&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;DDN und Bull werden eine Dateisystemprüfung unter /data/horse durchführen, um beschädigte Dateien zu identifizieren und zu reparieren. Zu diesem Zweck werden alle HPC-Cluster (einschließlich Login-Knoten, Data Movers und Data Ports) heruntergefahren. Während dieser Zeit ist kein Zugriff auf Daten in den HPC-Dateisystemen möglich:&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Beginn der Ausfallzeit: 4. Mai 2026, 17:00 Uhr 
Voraussichtliches Ende der Ausfallzeit: 6. Mai 2026, 12:00 Uhr
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;Um diese Ausfallzeit optimal zu nutzen, werden Bull, DDN und ZIH außerdem zusätzliche globale Wartungsarbeiten durchführen, wie z. B. Änderungen am Netzwerk und an den NFS-Dateisystemen sowie verschiedene Updates.
Sollten die Arbeiten an /data/horse deutlich länger dauern als die anderen Wartungsaufgaben, werden die Cluster Capella, Alpha Centauri und Romeo neu gestartet. Diese Cluster verfügen über alternative Scratch-Dateisysteme (/data/cat und /data/quokka), sodass Jobs dort ausgeführt werden können. Allerdings können nur Jobs mit dem entsprechenden Flag für das erforderliche Dateisystem (-L cat oder -L quokka) gestartet werden [1]. (Tipp: Sie sollten die Flags für die erforderlichen Dateisysteme am besten schon heute in Ihre Skripte einbauen.)&lt;/p&gt;
&lt;p&gt;[1] &lt;a href=&#34;https://compendium.hpc.tu-dresden.de/data_lifecycle/working/#working-filesystems&#34;&gt;https://compendium.hpc.tu-dresden.de/data_lifecycle/working/#working-filesystems&lt;/a&gt;&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>Wartung: HPC, 27.10.25, 07:00 – 29.10.25, 18:00 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2025-10-24-wartung_hpc_27-10-25_07_00_29-10-25_18_00_uhr_maintenance_hpc_27_october_2025_7_00_a-m-_29_october_2025_6_00_p-m-/</link>
        <pubDate>Mon, 27 Oct 2025 06:00:40 +0000</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2025-10-24-wartung_hpc_27-10-25_07_00_29-10-25_18_00_uhr_maintenance_hpc_27_october_2025_7_00_a-m-_29_october_2025_6_00_p-m-/</guid>
        <category>2025-10-29T17:00:00.000Z</category>
        <description>&lt;p&gt;Auf Grund von Wartungsarbeiten kommt es in diesem Zeitraum zu einem vollständigen Ausfall des Dienstes. Alle HPC-und Dateisysteme sind nicht verfügbar, es ist kein Zugriff (einschließlich Anmeldung und Datenübertragung) möglich.
Wir werden folgende Aktualisierungen vornehmen&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Dateisystemserver, Firmware&lt;/li&gt;
&lt;li&gt;Betriebssystem auf Barnard und Capella (auf die gleiche Version Rocky/RHEL 9.6, die wir auf Alpha und Romeo haben)&lt;/li&gt;
&lt;/ul&gt;</description>
        <content type="html">&lt;p&gt;Auf Grund von Wartungsarbeiten kommt es in diesem Zeitraum zu einem vollständigen Ausfall des Dienstes. Alle HPC-und Dateisysteme sind nicht verfügbar, es ist kein Zugriff (einschließlich Anmeldung und Datenübertragung) möglich.
Wir werden folgende Aktualisierungen vornehmen&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Dateisystemserver, Firmware&lt;/li&gt;
&lt;li&gt;Betriebssystem auf Barnard und Capella (auf die gleiche Version Rocky/RHEL 9.6, die wir auf Alpha und Romeo haben)&lt;/li&gt;
&lt;/ul&gt;
</content>
      </item>
    
      <item>
        <title>[Gelöst] Störung: HPC - Ausfall /data/horse</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2025-08-20-storung_hpc_-_ausfall_data_horse_fault_hpc_-_data_horse_crash/</link>
        <pubDate>Wed, 20 Aug 2025 11:15:25 +0000</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2025-08-20-storung_hpc_-_ausfall_data_horse_fault_hpc_-_data_horse_crash/</guid>
        <category>2025-08-20T14:01:26.849Z</category>
        <description>&lt;p&gt;Das Horse-Dateisystem ist aufgrund technischer Probleme ausgefallen.
Wir werden alle Rechenknoten leeren, um Probleme mit neuen Aufträgen zu vermeiden.
Wir arbeiten an einer Lösung und werden Sie informieren, sobald wir eine gefunden haben.&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Das Horse-Dateisystem ist aufgrund technischer Probleme ausgefallen.
Wir werden alle Rechenknoten leeren, um Probleme mit neuen Aufträgen zu vermeiden.
Wir arbeiten an einer Lösung und werden Sie informieren, sobald wir eine gefunden haben.&lt;/p&gt;
</content>
      </item>
    
  </channel>
</rss>
