Nehan株式会社 求人一覧機械学習エンジニア(AI Systems / Evaluation)
Nehan株式会社 求人一覧

機械学習エンジニア(AI Systems / Evaluation)

Nehan株式会社

仕事概要

仕事内容

【新しい公共を共に創ろう】
Nehan株式会社では、「新しい公共を共に創ろう」をミッションに、自治体や官公庁と取引を行う企業向けのAIプラットフォーム「Labid」を開発・提供しています。

公共営業では、入札・落札情報だけではなく、予算書、総合計画、議会録、自治体の組織情報など、さまざまな行政データを読み解きながら、前提条件の異なる各企業のメンバーごとにワークフローをサポートする示唆を出す必要があります。

Labidでは、こうした行政データを収集・構造化し、企業が持つ顧客情報や営業活動データと掛け合わせることで、営業先の発見、案件のレコメンド、情報探索、提案・書類作成といった業務をAIで支援しています。

今後、LabidのAI機能をさらに高度化していくためには、個々のAI機能を実装するだけではなく、

  • AIが参照しやすいデータをどのように構築するか
  • AIの出力の品質をどのように定義して測定するか
  • どのような評価データ・指標で品質を測るか
  • AIが失敗したとき、データ・検索・モデル・プロンプト・プロダクトのどこに原因があるかを特定し、改善するサイクルを作る

まで含めて、AIシステム全体を設計する必要があります。

本ポジションでは、LLM APIやプロンプトを利用したアプリケーション実装だけではなく、データ・モデル・評価・フィードバックをつなぎ、AI/MLシステムの品質を継続的に改善できる仕組みそのものを設計・実装いただきます。

採用背景

Labidには、入札・落札情報、予算書、総合計画、議会録などの行政データに加えて、顧客企業の営業活動に関するデータも蓄積され始めています。

これらのデータを活用して、

  • 自社がアプローチすべき自治体のレコメンド
  • 自社に合った案件のレコメンド
  • 行政データを横断した検索・分析
  • AI Agentによる営業活動や書類作成の支援

など、AIをプロダクトの中心に据えた機能を増やしていこうとしています。

そのため、当社ではMachine Learning Engineerの専門領域を大きく2つに分けて考えています。

Recommendation / Ranking

「誰に・何を・どの順番で提示するか」をモデル化し、レコメンドやランキングそのものの精度を高める領域です。

AI Systems / Evaluation

AIが利用するデータの意味を設計し、AIの出力を評価し、失敗を分析しながら、AIシステム全体の品質を継続的に改善する領域です。

本求人は後者のAI Systems / Evaluationを担当するMachine Learning Engineerの募集です。

AI機能が増えていくほど、個別のプロンプトやモデルを改善するだけでは、プロダクト全体としての品質を維持することが難しくなります。

「なぜこの出力になったのか」「変更によって本当に良くなったのか」を説明・計測できる状態をつくり、LabidのAI開発を再現性のあるエンジニアリングへ進化させることが、本ポジションを募集する背景です。

具体的な業務内容

AIが利用するデータ・意味構造の設計
  • 案件、自治体、企業、予算、行政施策などのエンティティ・リレーションの設計
  • AIやプロダクトから利用する指標・概念・意味の定義
  • 既存の行政データ・顧客データをAIが扱いやすい形へ変換するためのデータ設計
  • Semantic Layer、Knowledge Graph、Ontologyなどの必要性判断・技術選定・実装

特定の技術を導入すること自体を目的とはせず、AIが正しくデータを理解・利用できる状態をつくるために必要なアーキテクチャを選択します。

AI機能の評価基盤の設計・構築
  • AI機能ごとの成功条件・品質指標の設計
  • Evaluation Dataset / Golden Datasetの構築
  • Offline Evaluation Pipelineの設計・実装
  • LLM / Agent / Retrieval等の出力評価
  • 新しいモデル・プロンプト・データ変更による品質差分の継続的な測定
  • 実利用データやユーザーフィードバックを評価へ還元する仕組みの構築

「それっぽい回答が出た」ではなく、変更によってAI機能が本当に改善したのかを判断できる状態をつくります。

AIシステムのFailure Analysisと改善
  • 本番環境で発生する失敗ケースの分析
  • 元データ・データ定義、Retrieval / Ranking、モデル、Prompt / Agent Architecture、プロダクト・UXへの切り分け
  • 切り分け結果に基づく改善方針の設計

単一モデルの性能だけではなく、AIシステム全体を対象として品質改善を行います。

AI/MLアーキテクチャの設計
  • Machine Learning、Recommendation / Ranking、Embedding / Retrieval、Reranking、LLM、AI Agent、Rule-basedをどう組み合わせるかの設計
  • 精度に加えて、データ量、レイテンシ、コスト、説明可能性、運用負荷を考慮した技術選定
プロダクトチームとの連携
  • PdMと連携したAI機能の要求・成功指標の定義
  • Recommendation / Rankingを担当するMachine Learning Engineerとの連携
  • Backend Engineerと連携した本番システムへの組み込み
  • データチームと連携した行政データの品質改善
  • 評価結果をもとにしたプロダクト改善の提案

入社後に期待すること

まずは、Labidが保有している行政データ・顧客データと、現在提供しているAI機能を深く理解いただきます。

そのうえで、優先度の高いAI機能を一つ選び、「何を正解とするのか」「現在どの程度の品質なのか」「どこで失敗しているのか」を明らかにし、評価セットと評価方法を構築いただきたいと考えています。

その後、個別機能で構築した評価・改善の仕組みを共通化し、新しいAI機能を開発するときに自然と評価・改善まで行える開発プロセスへ広げていただきます。

中長期的には、Data → ML / LLM → Evaluation → Feedback → ImprovementというLabid全体のAI開発ループを設計し、AI/ML領域における技術方針やアーキテクチャの意思決定をリードいただくことを期待しています。

本ポジションの魅力

  • AIプロダクトの「評価」を0から設計できる
    生成AIを組み込むだけではなく、「そのAIが本当に良いのか」を定義するところから担当できます。
    Evaluation Dataset、Metrics、Failure Analysis、Feedback Loopなど、AIシステムを継続的に改善するための仕組みを0から構築できるフェーズです。

  • 大規模かつ複雑な行政データを扱える
    Labidでは、全国の自治体・官公庁から、入札、落札、予算、総合計画、議会録、組織情報など多様なデータを収集しています。
    単純なドキュメント検索ではなく、これらのデータ同士の意味や関係性をどのように表現し、AIに理解させるかという難易度の高いテーマに取り組めます。

  • ML・LLM・データを横断してシステムを設計できる
    特定のモデルや技術の専門家として閉じるのではなく、構造化データ、Machine Learning、Search / Retrieval、Recommendation、LLM / Agent、Evaluationを横断しながら、プロダクトとして最適なAIシステムを設計できます。
    「この問題にはLLMを使うべきなのか」「MLで解くべきなのか」「そもそもデータ構造を変えるべきなのか」というレイヤーから技術選定できます。

  • AI/MLの技術選定に大きな裁量を持てる
    まだ完成したAI基盤や決められたアーキテクチャが存在するフェーズではありません。
    プロダクトチームと議論しながら、Labidに必要なAI/MLアーキテクチャ、評価方法、データ構造を自ら設計していくことができます。
    単に既存システムを運用するのではなく、今後のLabidにおけるAI開発の土台そのものをつくるポジションです。

  • 行政領域に特化した、プロダクト価値に直結するAIを作れる
    LabidにおいてAIは追加機能ではありません。
    大量の行政情報から、顧客にとって意味のある情報を見つけ、次に取るべき行動まで導くことがプロダクトの中心価値です。
    AI/MLの改善が、そのまま顧客体験・事業価値の改善につながる環境で開発できます。

必須スキル

  • Machine Learningを利用した本番プロダクトについて、問題設定・設計・実装・評価・改善のいずれかを一貫して担当した経験
  • モデルやAIシステムの品質を、評価データ・評価指標・実利用データなどを用いて定量的に評価・改善した経験
  • AI/MLが利用するデータについて、データモデル・特徴量・ラベル・エンティティ等を設計した経験
  • Pythonを利用したMachine Learning / データ処理システムの実装経験
  • 曖昧な事業課題から、AI/MLで解くべき問題と評価方法を具体化した経験
  • PdM・Software Engineerなど、異なる専門性を持つメンバーと協働してプロダクトを開発した経験

※LLM APIを利用したアプリケーション開発やPrompt Engineeringのみではなく、データ・モデル・評価を含むAI/MLシステムの設計・改善経験を重視しています。

歓迎スキル

  • NLP / Search / Retrieval / Recommendation / Rankingいずれかの本番運用経験
  • LLM / AI AgentのEvaluation Frameworkを構築・運用した経験
  • Offline EvaluationとOnline Metricsの双方を設計した経験
  • Semantic Layer / Knowledge Graph / Ontology等の設計経験
  • Embedding / Vector Search / Rerankingを利用した検索システムの開発経験
  • Machine Learningモデルの学習・Fine-tuning・Feature Engineering経験
  • MLOps / LLMOps / AI Observability基盤の構築経験
  • Human-in-the-loopを含むフィードバックループの設計経験
  • AI/ML領域のアーキテクチャ・技術選定をリードした経験
  • 公共・行政領域への関心

求める人物像

  • モデルを作ることではなく、「事業上の問題をどうAI/MLで解くか」から考えたい方
  • AIの出力を見て終わるのではなく、「なぜこの結果になったのか」を掘り下げられる方
  • 精度改善のために、モデルだけでなくデータ構造やプロダクト仕様まで遡って考えられる方
  • 論文や新しい技術を追うだけでなく、本番プロダクトで使える形まで落とし込みたい方
  • 正解がまだ定まっていない領域で、自ら評価方法やアーキテクチャを定義したい方
  • AI/MLをプロダクトのコア技術として育てていきたい方

応募概要

給与

800~1,000万円
時給4,000円~

勤務地

108-6022 東京都港区港南2-15-1 品川インターシティA棟 22階

雇用形態
勤務体系
  • 雇用形態
    • アルバイト/業務委託/正社員
  • 勤務場所
    • リモートとオフィス勤務の併用
      • 勤務時間/場所は調整できます。土日や早朝深夜の勤務も可能です。
試用期間
福利厚生

⚫︎フルリモート可
⚫︎(勤務時間や業務内容に応じて)AIコーディングサービスの会社負担制度あり

企業情報

企業名
設立年月
本社所在地
事業内容

公共営業のためのAIワークフロー「Labid」を開発・提供するスタートアップです。

自治体・官公庁の市場では、入札情報だけでなく予算書、行政計画、議会録、過去の落札情報など、営業活動に必要な情報が全国のWebサイトやPDFに分散しています。

そのため企業の公共営業担当者は、膨大な行政情報の中から「どの自治体に、いつ、何を提案すべきか」を自ら調査・判断しなければならず、情報収集や案件管理に多くの時間を費やしています。

Labidは、全国の行政情報を収集・構造化し、AIを活用することで、公共営業の一連の業務を支援します。
・入札・落札・予算・行政計画・議会録などの行政情報を横断して検索
・案件、タスク、営業活動を一元管理
・提案や書類作成などの営業業務をAIで支援

行政が抱える課題と、それを解決できる民間企業がより適切につながる、新しい公共のあり方をつくっています。

【企業・サービスサイト】
・コーポレートサイト:https://nehan6.com/
・サービスサイト:https://labid.jp/

従業員数
企業サイトURL