Turing株式会社 採用情報全ての求人一覧3040_インフラエンジニア・プラットフォーム開発 / Infrastructure Engineer・ML Platform Engineering・SRE (GPUクラスタ)
Turing株式会社 採用情報

3040_インフラエンジニア・プラットフォーム開発 / Infrastructure Engineer・ML Platform Engineering・SRE (GPUクラスタ)

Turing株式会社

仕事概要

チューリングは「We Overtake Tesla」を掲げ、完全自動運転AIの開発に取り組むスタートアップです。2022年のほぼGPUゼロの状態から計算資源を増強し続け、2025年12月時点でオンプレミス・クラウド合わせてスパコン「富岳」のAI演算性能の約40%に相当する約0.7EFLOPS(FP16)を常時運用しています。
さらに今後2年でこれを5〜10倍に拡大する計画が、現在進行形で動いています。

また、現在はクラウド/オンプレ 上のSlurmクラスタが中心ですが、次世代オンプレミスGPU基盤の構築も進めています。GPU間をRoCE v2で800Gbps接続するネットワークや、クラウド・オンプレミスを横断したワークロード配置、将来的なKubernetesとの連携など、大規模計算基盤そのものを進化させていくフェーズです。

本ポジションでは、チューリングの機械学習基盤を支えるGPUクラスタ(主にクラウド上のSlurm環境)の運用・改善をリードし、オンプレを含めた計算資源の利用効率を最大化することをミッションとします。GPUの価格は非常に高額であるため、GPU利用効率やクラスタの信頼性を改善することが、非常に大きな費用対効果につながります。
機械学習エンジニア、インフラエンジニア、MLOpsエンジニアと連携しながら、OS・ネットワーク・ストレージから学習ワークロードまで横断して課題解決リードしていただけるエンジニアを募集しています。

GPU/HPCやSlurmの経験は必須ではありません。
WebサービスのSRE、Kubernetes Platform Engineer、クラウドインフラ等の経験を活かしながら、GPU/HPC領域へ専門性を広げたい方も歓迎します。

■ 具体的な業務内容

  • AWS・GCP・オンプレミスにまたがる大規模GPU計算基盤の設計・構築・運用・継続的な改善
  • GPUクラスタの信頼性向上に向けた、障害対応・原因分析・運用自動化・再発防止の仕組みづくり
  • GPU・ストレージ・ネットワーク・ジョブスケジューリングを含む、計算資源の可視化・性能分析・利用効率の最適化
  • MLエンジニアと連携した、学習ワークロードの実行環境・開発体験・CI/CD・モニタリング基盤の改善

必須スキル

※全てではなく、下記のいずれかやその他の技術に精通している方を探しています

  • Linuxを用いた本番インフラの運用
  • 障害対応経験Terraform / Ansible等を用いたInfrastructure as Codeの経験
  • Python / Go / Shell script等による運用自動化・ツール開発経験
  • Kubernetes、クラウド基盤、大規模分散システム等のいずれかの構築・運用経験
  • OS、ネットワーク、ストレージ、アプリケーションを横断して問題を切り分ける能力
  • 本番環境で安全なrollout、rollback、復旧を行った経験

歓迎スキル

※全てではなく、下記のいずれかやその他の技術に精通している方を探しています

  • マルチクラスタ構成の大規模GPUクラスタの構築・運用・性能改善経験
  • 学習ジョブの特性に応じた、スケジューリングやリソース最適化の経験
  • Slurm × Kubernetes の統合・運用経験
  • MLワークロード(学習・推論)や分散学習(PyTorch DDP 等)への理解
  • 並列分散ファイルシステム(ex. Lustre)や高速ネットワーク(InfiniBand / RDMA / EFA / RoCE)の知識
  • GPU/NIC/driver/firmwareのトラブルシュート

求める人物像

  • 経験の少ない領域や不確実性の高い環境でも、主体的に学び、優先順位をつけながら自走できる方
  • インフラからアプリケーションまで広い視点を持ち、MLエンジニアの課題を理解して技術的な解決策に落とし込める方
  • 部門や職種を横断して関係者と密に連携し、対面でのコミュニケーションも活かしながら、基盤の改善や新しい技術への挑戦を主体的に推進できる方

【参考情報】
▼会社HP
https://tur.ing/

▼ Turing Tech Blog
https://zenn.dev/p/turing_motors

▼チューリポ(オウンドメディア)
https://tur.ing/turipo

【応募時のお願い】

  • 応募時の書類(履歴書・職務経歴書)はPDF形式にてご提出いただきますようお願い申し上げます
  • 応募時の書類(履歴書・職務経歴書)やエントリーページの入力箇所に年収情報(現在年収や希望年収)を記載するのはお控えください
  • 年収情報については選考プロセスが進む中でHRよりヒアリングをさせていただきます

応募概要

給与

エンジニア

  • 想定年収:7,000,000円~10,000,000円
  • 基本給:444,449円~634,925円
  • みなし残業手当:138,891円~198,415円(※みなし残業40時間相当分)

シニアエンジニア

  • 想定年収:10,000,000円~15,000,000円
  • 基本給:634,925円~952,380円
  • みなし残業手当:198,415円~297,620円(※みなし残業40時間相当分)

プリンシパルエンジニア

  • 想定年収:15,000,000円~20,000,000円
  • 基本給:952,380円~1,269,843円
  • みなし残業手当:297,620円~396,827円(※みなし残業40時間相当分)

※上記は想定額のため、最終的には現年収を考慮しつつ経験・スキルを考慮して内定時に提示します
※キャリア採用の場合、下限については概ね1000万円を下回ることはありませんが上限については2000万円を超えるオファーをすることも検討しています

勤務地

■平和島オフィス
〒143-0006
東京都大田区平和島6丁目1-1 物流ビルA棟

▼アクセス
東京モノレール流通センター駅から徒歩7分

※通勤方法
・電車・バス等の公共交通機関
もしくは
・自家用車やバイクでの通勤

※通勤手当
・公共交通機関利用者は1ヶ月あたり40,000円を支給限度とします。
・自家用車利用者は燃費代相当費用+合理的な高速代(高速代は別途要件あり、要事前許可)を精算対象とします。
・バイク利用者は燃費代のみを精算対象とします。(高速代はお支払いの対象外となります。)

雇用形態
勤務体系

フレックスタイム制
コアタイム:11:00~15:00
フレキシブルタイム:08:00~11:00、15:00~22:00
標準的な勤務例:10:00-19:00(休憩1時間)
※ライフスタイルや業務に応じて始業・終業時間を柔軟に調整することが可能です

【休日休暇】
■土日祝日
■年次有給休暇:初年度は入社時に13日間付与
■夏季休暇・年末年始休暇
■ライフサポート休暇:特別有給休暇として入社日に5日間付与(有効期限は付与から1年間)
■結婚休暇(5日間)等の慶弔休暇
■出産休暇・育児休暇制度完備
■小学校3年生が終わるまで取得可能な育児時短制度 
■子の看護休暇・介護休暇(無給・5日)

試用期間
福利厚生

■社会保険完備
■交通費支給(会社が認めた通勤経路および通勤方法に基づき、会社が定める基準により算定した額を支給します。)
■社食(昼食支援)制度
■インフルエンザ予防接種の費用補助
■定期健康診断
■提携クリニックによる健康相談
■社外カウンセリング窓口
■PC選択制度(エンジニア対象)
■Turing Unlimited AI制度(直接雇用の全社員を対象に、業務に必要なあらゆるAIサービスを会社負担で上限なく利用できる制度です。)
■駐車場代補助制度(U30エンジニア対象)
■書籍購入制度
■ベビーシッター利用割引制度
■妊活検査(AMH卵巣予備能力指数検査)の無料検査制度
■提携クリニックによる女性特有の健康相談無料カウンセリング制度
■オフィスコンビニ(スマートマルシェ、オフィスグリコ)
■社内交流会(All Hands)の費用補助
■服装自由
■東振協の共同利用保養所サービス
■福利厚生賃貸サービス

企業情報

企業名
設立年月
本社所在地
資本金
従業員数
企業サイトURL