実践としての AI · 上級

小さい、ローカル、エッジモデル

一行でいうと: ボリュームが大きく、レイテンシが重要で、データが出られないとき——あなたの側の小さなモデルはクラウドの大きなモデルに勝る。

価値があるとき

固定された形式の狭い繰り返しタスク;プライバシーまたは規制上の要件;従量課金を高くするボリューム;またはネットワーク依存なしの即時応答の必要。

代わりに何を支払うか

運用:ハードウェア、可用性、更新、監視、維持方法を知るチーム。そして:オープンなタスクでの品質ギャップはまだ存在し、縮小したとしても。

中間の道

難易度によるルーティング:小さなモデルがほとんどのリクエストを処理し、難しいものは強力なモデルに行く。それが通常最適だ——コストが低く、重要な場所で品質が保たれる。

蒸留することもできる:強力なモデルを使って品質のある例を生成し、それで特定のタスクのために小さなモデルをファインチューンする。

さらに深く

単一の応答時間だけでなく、同時リクエストのスループットを測定する。ローカルモデルは負荷下で全く異なる動作をし、単一ユーザーテストによる容量計画は常にローンチ時のサプライズにつながる。