説明
ai& は、異種ハードウェア上で高性能なマルチテナント推論サービング・スタックを構築し、最適化するための Inference & Serving Engineer を募集しています。 この役割では、推論フレームワークの選定とチューニング、disaggregated prefill/decode、speculative decoding、continuous batching などの手法によるレイテンシとスループットの改善、ならびに小規模クラスターからマルチノード導入までのアーキテクチャのスケールに焦点を当てます。 責務には、メモリおよび KV-cache の最適化、Day 0 モデル対応、クロススタック統合、本番デバッグ、そしてハンズオンのテクニカルリードが含まれます。 このポジションには、推論エンジンの深い経験、multimodal generative AI に関する知識、分散システム・エンジニアリングの実績が求められます。
