WE ARE HIRING · 採用情報

Speech Edge AI Researcher [Tokyo/San Francisco]

Tokyo & San Francisco

Kotobaは最先端の音声AIを開発しています。Speech Edge AI Researcherとして、音声対話・音声認識・音声合成モデルを、スマートフォン、ウェアラブルなどのエッジデバイス上で高速・省メモリ・高品質に動作させる研究開発を担っていただきます。

ABOUT KOTOBA

⾳声⽣成 AI の最前線

Kotoba は、“東アジアの⾳声 AI のスタンダードになる”ことをミッションに掲げ、最先端の⾳声⽣ 成 AI モデルを開発する⽣成 AI 企業です。中核となるのは、まるで同じ⾔語を話しているかのよう な⾃然さで会話を繋ぐ、低遅延・⾼精度な⾳声翻訳モデル。⽇本語・英語・韓国語・中国語・スペ イン語をはじめとする主要⾔語ペアに対応し⾔語の壁を崩しています。さらに、データセンターか らエッジデバイスまで動作する超低遅延の speech-to-text/text-to-speech モデルも⾃社開発して おり、次世代の⾳声エージェントを⽀える基盤技術として、Fortune 50 企業や⽶国のビッグテック 企業へのライセンス提供を多数⼿がけています。世界トップ⽔準の⾳声 AI を、私たちは東京・サン フランシスコの2拠点から⽣み出しています。

この技術を、Kotoba は⾃社プロダクト「Kotoba app」(⽇本語名: 同時通訳)として iOS / Android で世に送り出しています。リリース以来、⽇本・韓国をはじめとする国・地域で爆発的な⽀持を獲 得し、1 ⽇あたり約 2,000〜3,000 件の新規ダウンロードをコンスタントに維持するまで普及して います。App Store および Google Play のカテゴリーランキングでは、Google 翻訳や Audible など を抑えてカテゴリー内 1 位を獲得した実績もあります。個⼈ユーザーに愛⽤されるだけでなく、⽇ 本を中⼼に⼤⼿エンタープライズへの導⼊も加速しており、SushiTech Tokyo をはじめ 100 近くの イベントの現場を⽀えてきました。メディアからも注⽬を集め、テレビ朝⽇、NHK、テレビ東京、 Abema Prime、PIVOT など数多くの番組で特集されています。

メディア掲載
— テレビ東京:https://www.youtube.com/watch?v=17CG6kSv2zs
— テレビ朝⽇:https://tver.jp/episodes/epy340m62i
— PIVOT:https://www.youtube.com/watch?v=N30YYfIqGEg

Kotoba は 2023 年、⽶国トップ⼤学で PhD を取得した 2 名の⽇本⼈の⽣成 AI 研究者によって創業されました。これまでに⽇⽶の著名 VC (Kindred Ventures, Globis Capital Partners など)や⽶国・⽇本の最⼤⼿企業の CVC から累計約 30 億円以上を調達し、さらに⽇本政府からも AI モデル学習に関する⼒強い⽀援を受けています。世界最⾼峰の研究⼒と、実際に市場で勝ち続けるプロダクト⼒。その両輪を併せ持つ、いまもっとも勢いのある⽣成 AI スタートアップのひとつです。

ROLE DESCRIPTION

役割

Speech Edge AI Researcherとして、最先端の音声AIを計算資源の限られたデバイス上で動作させるためのアルゴリズムとモデルアーキテクチャを研究開発します。対象は、音声対話、音声認識(ASR)、音声合成(TTS)、音声翻訳、ニューラル音声コーデックなどです。知識蒸留、構造化・非構造化プルーニング、量子化、低ランク化、アーキテクチャの再設計を用いて、精度や自然性を維持しながら、モデルサイズ、メモリ使用量、遅延、消費電力を削減します。研究とエンジニアリングの両面から、オンデバイス推論スタック全体を担当するポジションです。モバイルCPU・GPU・NPU向けのストリーミング推論パイプラインを構築・最適化し、実機上でボトルネックを分析します。カーネル、演算子、メモリ転送、スケジューリング、キャッシュを改善し、スマートフォン、ウェアラブル、組み込み環境で性能を検証します。モデル、モバイル、システムの各エンジニアと連携し、研究プロトタイプをKotobaのアプリ、SDK、顧客製品で利用できる堅牢な実装へとつなげます。

RESPONSIBILITIES

担当いただくこと

▪オンデバイス音声AIに向けたモデル圧縮および高効率アーキテクチャの研究テーマを設定し、実行する。

▪ASR、TTS、音声翻訳、Speech-to-Speech、ニューラル音声コーデック向けの小型・ストリーミングモデルを開発する。

▪知識蒸留、構造化・非構造化プルーニング、PTQ / QAT、混合精度、低ランク化、アーキテクチャ再設計を高度化する。

▪CPU・GPU・NPU向けの推論パイプラインを構築・最適化し、演算子、カーネル融合、メモリ計画、キャッシュ、実行スケジューリングを改善する。

▪実機でベンチマークを行い、品質、モデルサイズ、RTF、E2E遅延、初回音声生成時間、ピークメモリ、消費電力、熱特性を再現可能な形で評価する。

▪複数のランタイムおよびハードウェアバックエンドへモデルを統合し、デバイス間で性能・信頼性・一貫した挙動を実現する。

▪研究、モバイル、システムの各チームと連携して成果をプロダクト化し、技術文書、論文、必要に応じたオープンソース公開を通じて知見を共有する。

QUALIFICATIONS

Who we're looking for

Required

▪機械学習、音声処理、高効率ディープラーニング、コンピュータシステム、コンピュータアーキテクチャ、または関連分野の博士号・修士号、もしくは同等の研究開発経験。

▪モデル圧縮、高速推論、Edge AIのいずれかにおける、論文または本番システムで示された高い研究・開発実績。

▪知識蒸留、プルーニング、量子化、低ランク化、高効率アーキテクチャ設計、ハードウェアを考慮した学習のうち、1つ以上に関する実践的な専門性。

▪PyTorchまたはJAXを用いた高い実装力に加え、C / C++または同等のシステムプログラミング経験。

▪計算資源の限られたハードウェア上でニューラルネットワーク推論をプロファイリング・最適化した経験、およびCPU・GPU・NPU、メモリ階層、数値精度への実践的な理解。

▪厳密な実験を設計し、品質、遅延、メモリ、モデルサイズ、消費電力、可搬性のトレードオフを判断できる能力。

▪英語での業務コミュニケーション能力、および研究成果を迅速にプロダクトへつなげるスタートアップ環境への適応力。



Preferred

▪ ASR、TTS、音声翻訳、Speech-to-Speech、音声言語モデル、ニューラル音声コーデックの開発経験。

▪ Core ML、ExecuTorch、ONNX Runtime、LiteRT / TFLite、TensorRT、llama.cppなどのオンデバイス推論ランタイムの利用経験。

▪ Metal、Vulkan、CUDA、QNN、XNNPACK、カスタムカーネル、演算子融合などの高速化バックエンドに関する知識。

▪INT8 / INT4量子化、混合精度実行、QAT、ハードウェアを考慮したモデル設計の経験。

▪ストリーミング・低遅延のリアルタイム音声システム、およびモバイル、ウェアラブル、組み込み環境へのデプロイ経験。

▪分散GPU環境で大規模な教師モデルを学習・蒸留し、圧縮後の生徒モデルを大規模に評価した経験。

▪企業研究所、AI企業、テック企業、研究志向のスタートアップでの実務経験、または論文・オープンソースへの貢献実績。

HOW TO APPLY

ご関⼼をお持ちの⽅は、Kotoba の採⽤窓⼝(hiring@kotoba.tech)まで、

resume を添付して直接ご応募ください。

Copyright © Kotoba Technologies 2026

Japanese
Japanese
Japanese