Senior Network Engineer (Data Center, ML/AI)
SQUARE ONE RESOURCES sp. z o.o.
⚲ Poznań
Do uzgodnienia
Wymagania
- Ansible
- Terraform
- Bash
- Python
- Zabbix
- Prometheus
- Grafana
- Linux
- SONiC
- Cumulus Linux
Opis stanowiska
Nasze wymagania:
Praktyczne doświadczenie w administracji lub projektowaniu sieci Data Center.
Bardzo dobra znajomość technologii VXLAN, EVPN oraz BGP.
Doświadczenie z automatyzacją infrastruktury przy użyciu Ansible i Terraform.
Dobra znajomość systemów Linux w obszarze konfiguracji sieci.
Umiejętność tworzenia skryptów w Bash i/lub Python.
Doświadczenie z narzędziami monitoringu, takimi jak Zabbix, Prometheus lub Grafana.
Mile widziane:
Znajomość SONiC lub Cumulus Linux.
Doświadczenie z infrastrukturą GPU oraz środowiskami AI/ML.
Wiedza z zakresu NVIDIA AI Enterprise, AIaaS lub GPUaaS.
Doświadczenie we współpracy z zespołami DevOps lub R&D.
O projekcie:
Dołącz do projektu skoncentrowanego na utrzymaniu, rozwoju i optymalizacji nowoczesnej infrastruktury sieciowej Data Center wspierającej środowiska Machine Learning i AI.
Będziesz pracować nad rozwiązaniami zapewniającymi wysoką wydajność sieci dla klastrów GPU oraz rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D.
Zakres obowiązków:
Utrzymanie i rozwój infrastruktury sieciowej Data Center.
Projektowanie oraz optymalizacja środowisk sieciowych dla klastrów GPU wykorzystywanych w projektach AI/ML.
Automatyzacja konfiguracji i zarządzania infrastrukturą z wykorzystaniem Ansible i Terraform.
Konfiguracja oraz administracja środowiskami Linux w zakresie sieci.
Tworzenie i rozwój skryptów automatyzujących w Bash lub Python.
Monitorowanie wydajności i dostępności infrastruktury z wykorzystaniem narzędzi takich jak Zabbix, Prometheus i Grafana.
Współpraca z zespołami AI/ML, DevOps oraz R&D przy rozwoju nowoczesnej infrastruktury obliczeniowej.
Praktyczne doświadczenie w administracji lub projektowaniu sieci Data Center.
Bardzo dobra znajomość technologii VXLAN, EVPN oraz BGP.
Doświadczenie z automatyzacją infrastruktury przy użyciu Ansible i Terraform.
Dobra znajomość systemów Linux w obszarze konfiguracji sieci.
Umiejętność tworzenia skryptów w Bash i/lub Python.
Doświadczenie z narzędziami monitoringu, takimi jak Zabbix, Prometheus lub Grafana.
Mile widziane:
Znajomość SONiC lub Cumulus Linux.
Doświadczenie z infrastrukturą GPU oraz środowiskami AI/ML.
Wiedza z zakresu NVIDIA AI Enterprise, AIaaS lub GPUaaS.
Doświadczenie we współpracy z zespołami DevOps lub R&D.
O projekcie:
Dołącz do projektu skoncentrowanego na utrzymaniu, rozwoju i optymalizacji nowoczesnej infrastruktury sieciowej Data Center wspierającej środowiska Machine Learning i AI.
Będziesz pracować nad rozwiązaniami zapewniającymi wysoką wydajność sieci dla klastrów GPU oraz rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D.
Zakres obowiązków:
Utrzymanie i rozwój infrastruktury sieciowej Data Center.
Projektowanie oraz optymalizacja środowisk sieciowych dla klastrów GPU wykorzystywanych w projektach AI/ML.
Automatyzacja konfiguracji i zarządzania infrastrukturą z wykorzystaniem Ansible i Terraform.
Konfiguracja oraz administracja środowiskami Linux w zakresie sieci.
Tworzenie i rozwój skryptów automatyzujących w Bash lub Python.
Monitorowanie wydajności i dostępności infrastruktury z wykorzystaniem narzędzi takich jak Zabbix, Prometheus i Grafana.
Współpraca z zespołami AI/ML, DevOps oraz R&D przy rozwoju nowoczesnej infrastruktury obliczeniowej.
🔍 Dekoder Ogłoszenia
🟡
Nowoczesna infrastruktura sieciowa Data Center
Może oznaczać, że infrastruktura jest nowa, ale równie dobrze może to być po prostu marketingowe określenie na coś, co nie jest przestarzałe.
🟡
Wspierającej środowiska Machine Learning i AI
Może sugerować zaawansowane projekty, ale równie dobrze może oznaczać, że sieć musi po prostu obsłużyć ruch generowany przez te systemy, bez głębszego zaangażowania w same projekty ML/AI.
🔴
Rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D
Współpraca może oznaczać faktyczne partnerstwo, ale równie dobrze może oznaczać konieczność reagowania na ich potrzeby i zgłoszenia, bez realnego wpływu na kierunek rozwoju.
🔴
Utrzymanie i rozwój infrastruktury sieciowej Data Center
Połączenie 'utrzymania' z 'rozwojem' może oznaczać, że duża część pracy będzie polegać na gaszeniu pożarów i naprawianiu istniejących problemów, a rozwój będzie miał niższy priorytet.