Most AI Work Can Wait - Tomasz Tunguz
Router > 模型选择。三层架构:skill classifier → router → model selector。70-80%流量走本地模型,靠 queueing + 异步推理降费90%+。
标签 :ai-architecture、llm-ops、reading
Router > 模型选择。三层架构:skill classifier → router → model selector。70-80%流量走本地模型,靠 queueing + 异步推理降费90%+。
标签 :ai-architecture、llm-ops、reading