<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <link rel="alternate" type="text/html" href="https://betriebsstatus.tu-dresden.de/"/>
    <title>System_hpc_login_name on TU_dresden_title</title>
    <link>https://betriebsstatus.tu-dresden.de/affected/system_hpc_login_name/</link>
    <description>Vorfallshistorie</description>
    <generator>github.com/cstate</generator>
    <language>de</language>
    
    <lastBuildDate>2026-07-31T16:00:00+02:00</lastBuildDate>
    <updated>2026-07-31T16:00:00+02:00</updated>
    
    
    
      <atom:link href="https://betriebsstatus.tu-dresden.de/affected/system_hpc_login_name/index.xml" rel="self" type="application/rss+xml" />
    
    
      <item>
        <title>[Gelöst] Störung HPC</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-07-31-storung_hpc_ab_13-07-26/</link>
        <pubDate>Fri, 31 Jul 2026 16:00:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-07-31-storung_hpc_ab_13-07-26/</guid>
        <category>2026-08-10T14:53:00.000&#43;02:00</category>
        <description>&lt;p&gt;Als Vorsichtsmaßnahme wurde der Zugriff auf die HPC-Systeme aufgrund einer Störung vorübergehend gesperrt.&lt;br&gt;
Unser Team prüft derzeit die Auswirkungen und ergreift die erforderlichen Maßnahmen, um die Systeme wieder in einen sicheren Betriebszustand zu versetzen. Wir arbeiten daran, die HPC-Dienste so schnell wie möglich wieder aufzunehmen.&lt;br&gt;
Wir entschuldigen uns für die Unannehmlichkeiten und bedanken uns für Ihre Geduld und Ihr Verständnis.&lt;br&gt;
&lt;br&gt;
Update 05.08.26: &lt;br&gt;
Wir freuen uns, Ihnen mitteilen zu können, dass der Romeo-Cluster erfolgreich mit einem neuen Kernel wiederhergestellt wurde und nun wieder für den normalen Betrieb zur Verfügung steht.&lt;br&gt;
Zudem sind die Dataport-Knoten nun wieder online. Die Nutzer sollten nun wieder über die Dataport-Knoten auf ihre Daten zugreifen können.&lt;br&gt;
Die Arbeiten an den übrigen Clustern dauern noch an.&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Als Vorsichtsmaßnahme wurde der Zugriff auf die HPC-Systeme aufgrund einer Störung vorübergehend gesperrt.&lt;br&gt;
Unser Team prüft derzeit die Auswirkungen und ergreift die erforderlichen Maßnahmen, um die Systeme wieder in einen sicheren Betriebszustand zu versetzen. Wir arbeiten daran, die HPC-Dienste so schnell wie möglich wieder aufzunehmen.&lt;br&gt;
Wir entschuldigen uns für die Unannehmlichkeiten und bedanken uns für Ihre Geduld und Ihr Verständnis.&lt;br&gt;
&lt;br&gt;
Update 05.08.26: &lt;br&gt;
Wir freuen uns, Ihnen mitteilen zu können, dass der Romeo-Cluster erfolgreich mit einem neuen Kernel wiederhergestellt wurde und nun wieder für den normalen Betrieb zur Verfügung steht.&lt;br&gt;
Zudem sind die Dataport-Knoten nun wieder online. Die Nutzer sollten nun wieder über die Dataport-Knoten auf ihre Daten zugreifen können.&lt;br&gt;
Die Arbeiten an den übrigen Clustern dauern noch an.&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>Wartung: HPC-Filesystem, 29.07.2026, 09:00 - 13:00 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-07-29-wartung_hpc-filesystem_29-07-2026_09_00_-_13_00_uhr/</link>
        <pubDate>Wed, 29 Jul 2026 09:00:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-07-29-wartung_hpc-filesystem_29-07-2026_09_00_-_13_00_uhr/</guid>
        <category>2026-07-29T13:00:00.000&#43;02:00</category>
        <description>&lt;p&gt;Das Scratch-Dateisystem /data/horse wird erweitert, um den Zugriff auf kleine Dateien zu beschleunigen. Zu diesem Zweck werden alle Cluster am Mittwoch (29. Juli) zwischen 9:00 und ca. 13:00 Uhr für eine kurze Wartung offline geschaltet.&lt;/p&gt;
&lt;p&gt;Während der gesamten Zeit ist keine Datenübertragung zu/von /data/horse möglich&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Das Scratch-Dateisystem /data/horse wird erweitert, um den Zugriff auf kleine Dateien zu beschleunigen. Zu diesem Zweck werden alle Cluster am Mittwoch (29. Juli) zwischen 9:00 und ca. 13:00 Uhr für eine kurze Wartung offline geschaltet.&lt;/p&gt;
&lt;p&gt;Während der gesamten Zeit ist keine Datenübertragung zu/von /data/horse möglich&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>[Gelöst] Ausfall: HPC-Login</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-07-03-ausfall_hpc-login/</link>
        <pubDate>Fri, 03 Jul 2026 14:00:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-07-03-ausfall_hpc-login/</guid>
        <category>2026-07-15T14:21:00.000&#43;02:00</category>
        <description>&lt;p&gt;Aufgrund der Entdeckung einer neuen Sicherheitslücke wurde der Zugriff auf Barnard über SSH und JupyterHub deaktiviert.&lt;/p&gt;
&lt;p&gt;Wir danken für Ihr Verständnis.&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Aufgrund der Entdeckung einer neuen Sicherheitslücke wurde der Zugriff auf Barnard über SSH und JupyterHub deaktiviert.&lt;/p&gt;
&lt;p&gt;Wir danken für Ihr Verständnis.&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>Wartung/Downtime: HPC, 04.05.26, 17 Uhr - 06.05.26, 12 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-05-04-wartung_downtime_hpc_04-05-26_17_uhr_-_06-05-26_12_uhr/</link>
        <pubDate>Mon, 04 May 2026 17:00:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-05-04-wartung_downtime_hpc_04-05-26_17_uhr_-_06-05-26_12_uhr/</guid>
        <category>2026-05-06T12:00:00.000&#43;02:00</category>
        <description>&lt;p&gt;DDN und Bull werden eine Dateisystemprüfung unter /data/horse durchführen, um beschädigte Dateien zu identifizieren und zu reparieren. Zu diesem Zweck werden alle HPC-Cluster (einschließlich Login-Knoten, Data Movers und Data Ports) heruntergefahren. Während dieser Zeit ist kein Zugriff auf Daten in den HPC-Dateisystemen möglich:&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Beginn der Ausfallzeit: 4. Mai 2026, 17:00 Uhr 
Voraussichtliches Ende der Ausfallzeit: 6. Mai 2026, 12:00 Uhr
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;Um diese Ausfallzeit optimal zu nutzen, werden Bull, DDN und ZIH außerdem zusätzliche globale Wartungsarbeiten durchführen, wie z. B. Änderungen am Netzwerk und an den NFS-Dateisystemen sowie verschiedene Updates.
Sollten die Arbeiten an /data/horse deutlich länger dauern als die anderen Wartungsaufgaben, werden die Cluster Capella, Alpha Centauri und Romeo neu gestartet. Diese Cluster verfügen über alternative Scratch-Dateisysteme (/data/cat und /data/quokka), sodass Jobs dort ausgeführt werden können. Allerdings können nur Jobs mit dem entsprechenden Flag für das erforderliche Dateisystem (-L cat oder -L quokka) gestartet werden [1]. (Tipp: Sie sollten die Flags für die erforderlichen Dateisysteme am besten schon heute in Ihre Skripte einbauen.)&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;DDN und Bull werden eine Dateisystemprüfung unter /data/horse durchführen, um beschädigte Dateien zu identifizieren und zu reparieren. Zu diesem Zweck werden alle HPC-Cluster (einschließlich Login-Knoten, Data Movers und Data Ports) heruntergefahren. Während dieser Zeit ist kein Zugriff auf Daten in den HPC-Dateisystemen möglich:&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;Beginn der Ausfallzeit: 4. Mai 2026, 17:00 Uhr 
Voraussichtliches Ende der Ausfallzeit: 6. Mai 2026, 12:00 Uhr
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;Um diese Ausfallzeit optimal zu nutzen, werden Bull, DDN und ZIH außerdem zusätzliche globale Wartungsarbeiten durchführen, wie z. B. Änderungen am Netzwerk und an den NFS-Dateisystemen sowie verschiedene Updates.
Sollten die Arbeiten an /data/horse deutlich länger dauern als die anderen Wartungsaufgaben, werden die Cluster Capella, Alpha Centauri und Romeo neu gestartet. Diese Cluster verfügen über alternative Scratch-Dateisysteme (/data/cat und /data/quokka), sodass Jobs dort ausgeführt werden können. Allerdings können nur Jobs mit dem entsprechenden Flag für das erforderliche Dateisystem (-L cat oder -L quokka) gestartet werden [1]. (Tipp: Sie sollten die Flags für die erforderlichen Dateisysteme am besten schon heute in Ihre Skripte einbauen.)&lt;/p&gt;
&lt;p&gt;[1] &lt;a href=&#34;https://compendium.hpc.tu-dresden.de/data_lifecycle/working/#working-filesystems&#34;&gt;https://compendium.hpc.tu-dresden.de/data_lifecycle/working/#working-filesystems&lt;/a&gt;&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>Wartung: HPC Anmeldeserver, 30.04.2026 13-15 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2026-04-30-wartung_hpc_anmeldeserver_30-04-2026_13-15_uhr/</link>
        <pubDate>Thu, 30 Apr 2026 13:16:00 +0200</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2026-04-30-wartung_hpc_anmeldeserver_30-04-2026_13-15_uhr/</guid>
        <category>2026-04-30T13:47:00.000&#43;02:00</category>
        <description>&lt;p&gt;Aufgrund dringender Wartungsarbeiten an den Sicherheitssystemen haben wir alle Anmeldeserver vorübergehend außer Betrieb genommen. Wir werden sie in Kürze wieder in Betrieb nehmen.&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Aufgrund dringender Wartungsarbeiten an den Sicherheitssystemen haben wir alle Anmeldeserver vorübergehend außer Betrieb genommen. Wir werden sie in Kürze wieder in Betrieb nehmen.&lt;/p&gt;
</content>
      </item>
    
      <item>
        <title>Wartung: HPC, 27.10.25, 07:00 – 29.10.25, 18:00 Uhr</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2025-10-24-wartung_hpc_27-10-25_07_00_29-10-25_18_00_uhr_maintenance_hpc_27_october_2025_7_00_a-m-_29_october_2025_6_00_p-m-/</link>
        <pubDate>Mon, 27 Oct 2025 06:00:40 +0000</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2025-10-24-wartung_hpc_27-10-25_07_00_29-10-25_18_00_uhr_maintenance_hpc_27_october_2025_7_00_a-m-_29_october_2025_6_00_p-m-/</guid>
        <category>2025-10-29T17:00:00.000Z</category>
        <description>&lt;p&gt;Auf Grund von Wartungsarbeiten kommt es in diesem Zeitraum zu einem vollständigen Ausfall des Dienstes. Alle HPC-und Dateisysteme sind nicht verfügbar, es ist kein Zugriff (einschließlich Anmeldung und Datenübertragung) möglich.
Wir werden folgende Aktualisierungen vornehmen&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Dateisystemserver, Firmware&lt;/li&gt;
&lt;li&gt;Betriebssystem auf Barnard und Capella (auf die gleiche Version Rocky/RHEL 9.6, die wir auf Alpha und Romeo haben)&lt;/li&gt;
&lt;/ul&gt;</description>
        <content type="html">&lt;p&gt;Auf Grund von Wartungsarbeiten kommt es in diesem Zeitraum zu einem vollständigen Ausfall des Dienstes. Alle HPC-und Dateisysteme sind nicht verfügbar, es ist kein Zugriff (einschließlich Anmeldung und Datenübertragung) möglich.
Wir werden folgende Aktualisierungen vornehmen&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Dateisystemserver, Firmware&lt;/li&gt;
&lt;li&gt;Betriebssystem auf Barnard und Capella (auf die gleiche Version Rocky/RHEL 9.6, die wir auf Alpha und Romeo haben)&lt;/li&gt;
&lt;/ul&gt;
</content>
      </item>
    
      <item>
        <title>[Gelöst] Störung des Home-Laufwerks,06.10.2025</title>
        <link>https://betriebsstatus.tu-dresden.de/issues/2025-10-06-storung_des_home-laufwerks_06-10-2025_disruption_of_home_filesystem_06_okt_2025/</link>
        <pubDate>Mon, 06 Oct 2025 09:35:20 +0000</pubDate>
        <guid>https://betriebsstatus.tu-dresden.de/issues/2025-10-06-storung_des_home-laufwerks_06-10-2025_disruption_of_home_filesystem_06_okt_2025/</guid>
        <category>2025-10-07T06:46:27.251Z</category>
        <description>&lt;p&gt;Aufgrund von Funktionsstörungen der zentralen Home Laufwerke, gibt es
Probleme beim Login an &lt;em&gt;allen&lt;/em&gt; HPC-Diensten.&lt;/p&gt;</description>
        <content type="html">&lt;p&gt;Aufgrund von Funktionsstörungen der zentralen Home Laufwerke, gibt es
Probleme beim Login an &lt;em&gt;allen&lt;/em&gt; HPC-Diensten.&lt;/p&gt;
</content>
      </item>
    
  </channel>
</rss>
