落地的人工智能 · 综合

基于模型的系统的成本与延迟

一句话: 成本的大头来自输入的文本,延迟的大头来自输出的文本——所以这两者的解法是不同的。

降低成本

少附带上下文;把简单请求路由到小模型;对固定部分利用缓存;把不急的合并成批处理。

按业务单位计算成本——每次请求、每个用户、每笔订单——而不只是一个月度总额。这样你才看得出增长是否划算。

加快速度

把回答以流式推给用户,比任何其他优化都更能缩短「感受到的等待」。缩短输出长度会直接见效。以及能并行跑的任务——就并行跑。

守住预算

每日上限、越过阈值时告警,以及自动化流程里的步数上限。一个错误的循环能在几小时里烧掉一个月的预算。

深入一层

给每次调用打上用户、功能和用途的标签。没有标签,「是什么导致了这次尖峰」这个问题只能靠猜来回答,而且你没法关掉那个昂贵又不太有用的功能——这种功能几乎总是存在,只有当你去看的时候才会浮现。