返回案例展示
AI Infra · Personal Agent Platform

面向 C 端个人 Agent 的 AI Infra

从用户理解、长期记忆和主动推荐,到 EKS GPU 调度、模型路由与 SGLang 推理加速的一体化基础设施。

Amazon EKSSGLangGPU AutoscalingModel RoutingAurora & OpenSearch
体验交互 Demo
Solution Case
面向 C 端个人 Agent 的 AI Infra
方案概要

让个人 Agent 从第一天起就理解用户

这是一个面向 C 端的个人 Agent 项目,我们负责完整 AI Infra 的设计与搭建。平台将用户授权的数据、偏好、历史记忆和实时行为组织为可检索的用户上下文,让用户无需反复编写复杂 Prompt,Agent 也能主动给出符合偏好的推荐。EKS CPU Pod 承载 Agent 编排、画像、记忆、工具网关和主动通知;策略路由根据任务复杂度、隐私等级和成本选择小模型、中型模型、VPC 内私有模型、Embedding 或安全模型;GPU Node Group 负责私有 LLM、Embedding 与重排序模型的弹性运行。

在保障隐私边界的同时降低用户交互成本,并通过弹性 GPU、分层模型路由和推理加速控制延迟与算力成本。

EKS HybridCPU / GPU 混合调度
SGLang高吞吐推理加速
Privacy Route敏感数据 VPC 隔离
实现流程

用户上下文、模型路由与弹性推理闭环

01

理解用户

从 Profile、Memory 与行为事件中按权限加载上下文,减少重复 Prompt,同时避免无边界地拼接个人数据。

02

策略路由

按任务复杂度、隐私、延迟和成本,将请求路由到小模型、中型模型、私有 LLM、Embedding 或安全模型。

03

弹性推理

结合队列深度、Token 预算和显存水位动态扩缩 GPU,并通过模型并行、量化与热池降低冷启动。

04

主动服务

通过 SGLang 的前缀缓存、RadixAttention 和连续批处理加速生成,再由 EventBridge 驱动符合偏好的主动推荐。

交互体验

实时 AI Infra 数据流

选择不同请求场景,观察用户画像加载、数据检索、模型路由、EKS GPU 扩容和 SGLang 流式推理的完整过程。

Personal Agent AI PlatformEKS · VPC Private · Multi-model Runtime
EKS Cluster Healthy
请求场景结合画像与长期记忆生成个性化旅行建议
GPU 节点2 / 8warm pool
显存使用率34%18.4 / 54 GB
生成吞吐SGLang runtime
P95 延迟waiting
Consumer Agent Request主动推荐
preference: travelmemory: 128prompt: 8 tokens
context
EKS CPU PodAgent 服务编排
Agent OrchestratorProfile ServiceMemory ServiceTool GatewayProactive Notification
policy
模型策略路由Policy Router
Small ModelclassificationMedium ModelconversationPrivate LLMVPC sensitiveEmbeddingretrievalSafety Modelguardrail
schedule
GPU Node Group弹性推理集群
GPU-01GPU-02GPU-03GPU-04
GPU Warm Pool 已准备
Private LLMEmbedding ModelReranker
SGLang RuntimeRadixAttentionPrefix CacheContinuous Batching
用户理解与记忆数据层权限、画像、向量记忆、缓存和事件流
Aurora PostgreSQLOpenSearch / pgvectorElastiCache RedisAmazon S3SQS / EventBridge

架构模拟 Demo:指标和调度事件均为前端生成,不会创建真实云资源。

面向 C 端个人 Agent 的 AI Infra | Wenku Tech