【正社員】データエンジニア — 生成AI×Databricksで高品質なデータ基盤を構築|1,600万件超の法人・組織データベースの取得・統合・品質検証をAI前提で実装する|フルリモート・フルフレックス
仕事概要
<SalesNowについて>
SalesNowは「誰もが活躍できる仕組みをつくる。」を掲げ、働き方を根本から変える挑戦をしています。働き手が減る日本で、1人が生み出せる価値をどこまで増やせるか。企業データとAIで、BtoBの仕事の進め方そのものを組み替えることが、SalesNowの事業です。
その土台が、1,600万件超の法人・組織データベースです。企業・組織・拠点・部署までをユニークに構造化し、レコード数は80億。企業データベース収録件数No.1です(2025年10月期・日本マーケティングリサーチ機構調べ)。
この規模と粒度は、Webを集めるだけでは組み上がりません。SalesNowは独自の収集網「SalesNow Data Network」を3つのルートで持っています。1つめは、Web情報をAIで日次更新するデジタルの基盤で、数百万件規模のタスクをLLMを含む技術で処理します。2つめは、数万人規模のデータリサーチャーのパートナーネットワークと社内の体制によるアナログな収集で、実地調査から紙の資料の読み取りまで、検索では出てこない情報を取りに行きます。3つめは、月間700万PVの自社メディア(企業版Wikipedia)に集まるユーザー投稿で、このユーザーのネットワークもアナログな収集の一部を担います。
データそのものにも独自性があります。独自のJCコードは、本社・工場・支社支店・店舗まで拠点ごとに一意のIDを振る体系で、多拠点やグループ会社を正確に串刺しできます。組織図と部署の直通番号まで持ち、部署連絡先は750万件超。代表電話を経由せずに狙う部署へ直接つながります。この750万件超の連絡先が、企業・拠点・部署のどこに属するかを崩さずに保てるかは、データエンジニアの設計で決まります。
法人番号・社名・住所・電話・URL・メールの多角キーを15段階の優先度で照合し、1社に収斂させます。確定しなかった企業は、AIワークフローを使って最新のWebから補完します。付与する企業情報は50項目超。業種は大業界30件〜/小業界400件〜/事業内容3,000件〜の3層で持ち、従業員数は月次の時系列で追えます。80億レコードの基盤で、この細かな分類と月次の推移を保ったまま、表記揺れや欠損を見つけて正す処理を設計・実装できます。
AIの出力の品質は、参照するデータの品質で決まります。SalesNowは、AIと営業システムにデータを供給する、AI時代の企業データインフラです。
企業データは、『SalesNow』の画面と、Salesforce・HubSpot・kintoneとの連携で届けています。Data APIはベータ版として、Company・News・Recruit・Organization の4種別を提供しています。SalesNow MCPでは、Claude・CursorなどのAIエージェントから企業データを直接利用できます。届け先が増えるほど、同じデータが人の画面とAIの入力の両方で使われ、スキーマの決め方も鮮度の基準もデータエンジニアが設計し直す対象になります。営業戦略コンサルティング、データ基盤の構築、AI実装、営業BPOまで一社で提供しています。プロダクト『SalesNow』が扱うのは営業の領域です。会社が企業データとAIで組み替えようとしている仕事は、営業に限りません。あなたが設計する基盤は、1つのプロダクトの裏側にとどまりません。画面・CRM連携・Data API・SalesNow MCPへの供給をまとめて支え、営業に限らないBtoBの仕事を企業データとAIで組み替えていく先を見据えて、設計の判断に関われます。ヤマト運輸、パナソニック、LINEヤフー、SMBC日興証券、パーソルキャリア、JCB、GMOペイメントゲートウェイなどへの導入実績があります。
営業の専門性・データ基盤・AIの先進性は、どれか1つなら他にもあります。3つが揃っていることが、SalesNowの差です。社内のコンサルタントやAIエンジニアと直接議論し、顧客のデータ利用で見つかった課題を、収集・名寄せ・品質検証の設計に反映できます。
<募集背景>
人を増やした分だけ売上が伸びる時代は、終わりました。 人がAIと一緒に働くほど、AIが扱う企業データの正確さが、そのまま仕事の質になります。SalesNowは組織が大きくなる前にAI前提の組織へつくり替え、バリューの1つに「AIネイティブ」を掲げています。2025年11月を起点に、社員1人あたりARRを3年で10倍にする目標を置いています。人を増やさずに届けるデータを増やすには、取得と検証の工程そのものを組み替える必要があります。データエンジニアは、その組み替えを自分の手で設計する立場にいます。
企業データの提供は、『SalesNow』の画面に加えてData APIとSalesNow MCPへ広がっています。DatabricksやRedashを使った基盤は整いつつありますが、バッチ処理の安定化、APIのスケール対応、コスト効率を意識した性能最適化など、解くべき課題は増え続けています。チームの設計方針のもとで、データの取得から統合、品質の検証までを実装し、改善するデータエンジニアを募集します。基盤全体のアーキテクチャの設計と並行して実装を担い、設計の議論に加わりながら、基盤全体を見渡す役割へ広げていけます。
<ミッション>
あなたのミッションは、デジタルの日次更新、アナログな収集、ユーザー投稿という性質の違う3つのルートから届く情報を、根拠のある1つの企業像として構造化することです。同名企業を見分け、住所の表記揺れや合併・移転を扱い、独自のJCコードで企業から拠点単位まで名寄せします。掲載終了や企業サイトの更新を捉え、情報の鮮度と正確さを確かめ続ける監視の仕組みも、あなたが設計します。あなたが名寄せした1件が、大手企業の担当者とAIエージェントにとって、同じ企業を正しく識別する根拠になります。
<お任せしたい業務内容>
数十TB・80億レコード規模の企業データ基盤の構築・改善を担います。入社初日から、インフラ・ガバナンス・コスト最適化まで横断的に関わります。具体的には、以下のいずれか、もしくは複数を担当していただきます。
- Webデータクローリングのためのパイプライン新設や改善
- データのクレンジング・エンリッチメント・名寄せ処理の実装
- データ品質モニタリング環境の構築・改善
- スケーラブルでコスト効果の高いデータ基盤への改善
- 将来的なデータサイエンス活用を見据えたデータ基盤・品質整備の設計
入社後に取り組む課題の例
- 「その求人はまだ募集中か」の判定を直す。求人の停止は、営業が使うシグナルの1つです。一覧ページに掲載終了情報を出さない媒体があり、取得した求人一覧の差分で募集終了を判定すると、一時的な取得漏れを掲載終了と取り違えるおそれがあります。募集中の求人を終了扱いにする誤りと、終了した求人を募集中として残す誤りのどちらを抑えるか、媒体ごとに判定基準を決めて実装します。
- 企業のWebサイトの更新を追う。会社概要やサービス情報を新しく保つため、全企業のWebサイトの情報を取得し、更新の差分を検知する処理を実装します。
- 企業データの判定にLLMを組み込む。上場企業の開示資料(IR情報)をLLMで構造化し、人が定めた基準でLLM as a Judgeによる判定を行います。チームで定めた品質基準のもとで、担当する判定の条件を決めて実装します。
※従事すべき業務の変更の範囲:有り
<利用するツール・技術>
- データ収集: Python(Scrapy)、AWS Fargate for Amazon ECS、Amazon Managed Workflows for Apache Airflow
- データストア: Amazon S3、Amazon Aurora PostgreSQL
- データ可視化: Redash
- データトランスフォーム: Apache Spark on Databricks(Delta Lake。生データ→クレンジング→提供用の3層で処理)
- 言語: Python(FastAPI)、TypeScript(Next.js)、SQL
- ミドルウェア: PostgreSQL、Elasticsearch / OpenSearch
- インフラ: AWS、GCP、Fastly
- AI/LLM: Amazon Bedrock、Azure OpenAI、Claude、Gemini
- 開発ツール: Claude Code、Codex、Cursor、GitHub Copilot、CodeRabbit、n8n
- デザイン: Figma
- コミュニケーション: Slack、GitHub、Notion、Asana、Google Workspace
週1回60分のチーム定例、メンターとの1on1による技術相談、週1回60分の技術勉強会があります。担当するパイプラインの設計をメンターに相談し、勉強会で得た知見をデータ基盤の改善に生かせます。
<AIを前提にした働き方>
- Claude・Geminiは全員が使え、Codexも併用します。クローラの実装、名寄せの検証、品質チェックの設計など、用途に合うモデルを自分で選んで試せます。
- 成果物は複数のLLMにレビューを依頼し、採否は人が根拠を確認して決めます。PRの一次レビューにはCodeRabbitも使います。
- 目的と予算を合意したあとは、担当者が進め方を決めます。AIで処理する範囲、人が判断する範囲、使うツールも自分で決めます。
- AIへの指示書も、コードと同じくPRでレビューを受けます。成果物はGitHubで管理し、プロンプトを勘に頼らず、再現と検証ができる成果物として設計します。
- データ取得では1件あたりの費用まで確認し、精度と費用を比べて取得方法を自分で選びます。LLMの時代に欠かせない、データの費用と精度を設計する判断を、実際の予算を使って重ねられます。
- 職種を問わず、AIで自分の仕事を組み替えることを求めています。データエンジニアなら、取得・検証の工程を自分で組み替え、1人で扱えるパイプラインの数を増やしていけます。
- 全社でマージされたPRは、直近30日で2,229本です(2026年9月12日時点・社内計測)。名寄せや品質判定の改善を、コードとAIへの指示書に落とし込みます。複数のLLMと人のレビューを通じて、変更の妥当性をデータの精度と処理費用の両面から説明する力を磨けます。
<ポジションの魅力>
- メンバークラスから設計判断に関われます。何を集めるか、どこまで正確なら使えるかを、担当する処理の範囲で自分で決め、根拠を示して実装まで持っていきます。
- 80億レコード・数十TBの基盤と、55媒体のクローラ、Databricksの3層処理を扱います。媒体ごとの取得漏れを考慮した掲載終了の判定、JCコードで拠点まで結びつける名寄せ、その品質を確かめる監視までを実装します。データの正確さ・処理性能・運用コストを同時に天秤にかける設計は、この規模の基盤でこそ身につきます。
- 扱うのはWebから取れるデータだけではありません。数万人規模の調査網と社内の体制がアナログに集めた情報も、自社メディアに集まるユーザー投稿も、同じ1社に束ねます。入力の性質が違うデータを1つの企業像に収斂させる仕事は、公開データだけを扱う環境では経験できません。
- 整えたデータは、『SalesNow』の画面・CRM連携・Data API・SalesNow MCPを通じて、主に大手企業・上場企業で使われます。改善したデータ品質が、名寄せとシグナルの精度として顧客の判断に直接届きます。
- LLMを本番のデータ処理に組み込み、コストと精度を同時に管理する経験が身につきます。AIツールへの支出は1人あたり月平均10万円以上(会社負担)です。その環境で、どこまでをLLMに処理させ、どこから人が判断するかを自分で設計します。
- AI前提で取得・検証の工程を組み替え、1人で回せるパイプラインを増やす。品質・性能・コストを実測で確かめながら、1人が扱えるデータ量を押し上げる仕組みを自分でつくれます。取得・検証にかかる人の時間を減らす設計を通じて、社員1人あたりARRを3年で10倍にする目標に貢献できます。
- 経営陣も自分でコードを書きます。取得方法の変更やコストと精度の兼ね合いを、実装の重さが分かる相手と直接議論でき、技術の選択を事業への影響まで含めて詰められます。
- メンバーとして名寄せ・品質監視・クローラの実装を積み上げた先に、基盤全体のアーキテクチャを決める役割、さらにテックリードへと広げていけます。データ量とプロダクトの提供先(画面・Data API・SalesNow MCP)が同時に広がっている今だから、任される範囲の広がりも速くなります。
2〜3年後、AIを使えることは当たり前になります。差がつくのは、AI前提で組織と業務を設計できるかどうかです。SalesNowは、それを毎日やっています。
<選考プロセス>
原則すべてのステップをオンラインで実施します。
- エントリー
- 書類選考
- Web面談(2〜5回)
- リファレンスチェック
- オファー面談
<参考リンク>
- 採用サイト:https://recruit.salesnow.co.jp/
- 全社資料:https://speakerdeck.com/salesnow/company-deck
- Culture deck:https://speakerdeck.com/salesnow/culture-deck
- CEO note:https://note.com/atsunori_muraoka
- COO note:https://note.com/yosukekume
- 一緒に働くメンバーのインタビュー(開発チームのエンジニア。企業データをAPI・MCPで届ける開発について):https://note.com/salesnow/n/na813feacc9cb
必須スキル
- Python / SQLを用いたデータ処理の実務経験3年以上
- パブリッククラウドの利用経験3年以上
- データ収集・加工パイプラインの構築経験
- RDB(PostgreSQL / MySQL等)の基本的な設計・操作経験
歓迎スキル
- Apache Spark(PySpark含む)でのデータ処理経験
- AWS Analytics系サービスの利用経験
- Databricksの利用経験
- データマネジメントの経験
- Git / GitHubを用いたチーム開発の経験
- DataOpsの考え方への共感
求める人物像
- ミッション・バリュー(AIネイティブ・コト志向・最高品質)に共感し、AIを使いこなす意志がある方
- シリーズB目前のスタートアップならではのスピード感を楽しみ、変化の中でも目的から考えて課題を発見し、解決に導ける方
- 誠実さとオーナーシップを持って、チームや顧客に向き合える方
- 新しい技術や知識を自ら学んで試し、前提を疑いながら技術的な課題に挑み、担当範囲の設計判断まで担える方
- データの品質に対して妥協せず、仕組みで品質を担保できる方
- 検討結果や改善内容をチームに積極的に共有し、顧客やビジネス職の声を改善につなげられる方
※詳しくはカルチャーデックをご覧ください。
https://speakerdeck.com/salesnow/culture-deck
応募概要
| 給与 | 年収500〜1,200万円 |
|---|---|
| 勤務地 | 渋谷オフィス(リモートワーク可) |
| 雇用形態 | 正社員 |
| 勤務体系 | 勤務形態
勤務時間
休日・休暇
|
| 試用期間 | あり(3ヶ月) |
| 福利厚生 | 各種手当
健康・安心サポート
その他
|
企業情報
| 企業名 | 株式会社SalesNow |
|---|---|
| 設立年月 | 2019年8月 |
| 本社所在地 | 東京都渋谷区桜丘町1-4渋谷サクラステージSHIBUYAサイドSHIBUYAタワー7F |
| 事業内容 | SalesNowは「誰もが活躍できる仕組みをつくる。」を掲げ、働き方を根本から変える挑戦をしています。BtoBの仕事の進め方を、企業データとAIで組み替える会社です。 土台は、AI時代の企業データインフラ「SalesNow」。1,600万件超の法人・組織データベース(80億レコード)を、画面・API・MCP・AIワークフロー・カスタムAIエージェントで届けています。企業データベース収録件数No.1(2025年10月期・日本マーケティングリサーチ機構調べ)。 Webに出ていない膨大なアナログ・クローズドな情報は、数万人規模の調査網と社内の体制、自社メディアのユーザー投稿から集めています。2026年3月にカスタムAIエージェント、4月にMCPサーバーの提供を開始しました。 2〜3年後、AIを使えることは当たり前になります。差がつくのは、AI前提で組織と業務を設計できるかどうかです。 |
| 資本金 | 9800万円 |
| 従業員数 | 55 |
| 企業サイトURL | https://salesnow.co.jp/ |