Together AIがDedicated Model Inferenceにカナリアロールアウトを追加
Together AIはDedicated Model Inferenceにカナリアロールアウトを追加した。これにより、稼働中のエンドポイントの背後にあるモデルをダウンタイムなしでアップグレードできる。トラフィックは現在のデプロイから新しいチェックポイントへ、段階的なゲートを経て移行し、既定では5%、25%、50%、100%となる。
トラフィックが移行する前にヘルスチェックが実行される。各ステップの後、メトリクスゲートは新しいモデルのp95レイテンシとエラー率を以前のデプロイと比較する。ゲートが作動すると、ロールアウトは再開、100%への昇格、またはロールバックされるまで、カナリアの割合で一時停止する。
カナリア、ブルーグリーン、ローリングの各戦略は、tg CLI、REST API、Python SDKから現在利用できる。Together AIはロールアウトの開始方法をカナリアロールアウト:本番環境のモデルをダウンタイムなしでアップグレードで説明している。