快手电商披露B端端云协同调度实践
随着推理模型、Coding Agent、Agent Runtime 与 Agent Framework 持续发展,AI 正从问答工具转向可规划、可调用工具并执行任务的软件系统。软件团队的关注点也从训练模型、部署模型和优化提示词,延伸到如何让具备自主能力的 AI 在生产环境中稳定、可信、可控地运行。2026 年上海站全球软件开发大会将于 10 月 22 日至 24 日举行,主题聚焦 Harness AI 时代的工程实践,覆盖 AI Native 架构、Agent Runtime、AI Infra、数据系统、安全可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等方向。
快手电商 B 端商家前端负责人李东东将参加“端云协同与 AI Native 终端生态”专题,并分享《端侧优先,云端兜底:端云协同调度在 B 端应用的工程实践》。在 B 端产品接入 AI 后,纯云端推理通常会带来高延迟、高成本和数据出域合规风险;纯端侧推理则受限于设备算力,难以承担复杂任务。其团队搭建的端云协同调度系统采用三层决策:规则引擎短路、端侧推理、云端推理,并支持混合流水线。调度器会根据任务复杂度、端侧模型状态、设备性能和网络质量选择执行路径,云端异常时可自动降级。目前该系统已集成到 B 端桌面端,规则引擎可覆盖 60% 以上高频场景,端侧推理延迟稳定在 100ms 以内。
李东东自 2021 年加入快手后,负责商家工作台、生意通等 B 端核心产品的前端架构演进,长期关注端智能在商家场景中的工程落地,参与端侧推理引擎选型、端云协同调度器设计、A2UI 智能界面生成等实践,并持有端智能相关发明专利。本次分享将解释 B 端为何需要端云协同,分析“延迟高、成本贵、数据出域”三类痛点,以及端侧优先处理高频轻量任务、复杂任务交由云端处理的分工逻辑。
演讲还将展开调度器设计目标与实现细节:在成本、延迟、隐私和效果之间动态平衡,遵循“端侧优先、云端兜底、规则短路、混合增效”的原则;通过规则引擎、端侧推理、云端推理形成递进式链路;结合任务复杂度、模型就绪状态、网络质量和隐私敏感度进行实时决策;并以“查订单”等场景说明端侧预处理、云端推理、端侧后处理组成的混合流水线。端侧模型选型方面,将比较推理性能、内存占用和框架兼容性,并介绍量化、预加载等优化方式。
该方案在落地中也面临多项工程难点,包括端侧模型能力上限与业务复杂度之间的取舍、设备碎片化带来的兼容成本、调度决策时信息不完整、端侧模型冷启动耗时数秒、混合流水线跨端云状态传递与异常恢复复杂等。其亮点在于三层递进式调度体系,以及“乐观路由+执行中重评估”策略:先按最优路径执行,同时持续监测状态,遇到问题再实时降级,而不是追求事前 100% 准确判断。
除该专题外,大会还规划了 Loop Engineering、行业 Agent 创新实践、Agent 自主进化、Agent as a Service、Vibe Coding 时代的新质量债、面向 AI 的 SRE 可靠性工程、金融 AI Native 工程实践、AI Infra 与 AI Native 架构等 20 个专题论坛,预计将有 100 多位来自不同企业和领域的专家分享一线经验。会议报名目前处于 8 折倒计时最后一周,报名可立减 1360 元。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文