理解用户
从 Profile、Memory 与行为事件中按权限加载上下文,减少重复 Prompt,同时避免无边界地拼接个人数据。
这是一个面向 C 端的个人 Agent 项目,我们负责完整 AI Infra 的设计与搭建。平台将用户授权的数据、偏好、历史记忆和实时行为组织为可检索的用户上下文,让用户无需反复编写复杂 Prompt,Agent 也能主动给出符合偏好的推荐。EKS CPU Pod 承载 Agent 编排、画像、记忆、工具网关和主动通知;策略路由根据任务复杂度、隐私等级和成本选择小模型、中型模型、VPC 内私有模型、Embedding 或安全模型;GPU Node Group 负责私有 LLM、Embedding 与重排序模型的弹性运行。
在保障隐私边界的同时降低用户交互成本,并通过弹性 GPU、分层模型路由和推理加速控制延迟与算力成本。
从 Profile、Memory 与行为事件中按权限加载上下文,减少重复 Prompt,同时避免无边界地拼接个人数据。
按任务复杂度、隐私、延迟和成本,将请求路由到小模型、中型模型、私有 LLM、Embedding 或安全模型。
结合队列深度、Token 预算和显存水位动态扩缩 GPU,并通过模型并行、量化与热池降低冷启动。
通过 SGLang 的前缀缓存、RadixAttention 和连续批处理加速生成,再由 EventBridge 驱动符合偏好的主动推荐。
选择不同请求场景,观察用户画像加载、数据检索、模型路由、EKS GPU 扩容和 SGLang 流式推理的完整过程。
架构模拟 Demo:指标和调度事件均为前端生成,不会创建真实云资源。