Portfolio
AI Platform Architecture Portfolio
面向 AI 平台、机器人云、Agent 工程化和分布式系统岗位的个人实验室与开源项目整理。
涉及生产经历的内容只描述已实际负责且已脱敏的系统;实验项目不会被表述为生产规模。文章可以使用 AI 辅助写作,但代码、测试和故障复现由本人验证。
相关链接:GitHub · AI Video Studio · Margrop Labs · Coding Plan Dashboard
Selected Engineering Work
01 · 机器人云平台迁移到 AI Platform
长期负责机器人云平台的 OpenAPI、设备状态、任务调度、异步处理、幂等、恢复和生产可观测性。对应到陪伴机器人 AI Platform,重点是把设备身份、会话状态、工具调用、模型路由、长期记忆和故障恢复组织成统一的平台边界。
可讨论: 多租户、设备/家庭成员隔离、状态一致性、断线重连、权限和高风险动作确认。
02 · AI Video Studio
Provider-neutral 的 AI 内容流水线,覆盖 Planner、Shot、Queue、Worker、Provider、Storage 和 Render。
可讨论: 任务幂等、Worker lease、超时/重试、Provider 限流、TTS/视频异步任务、成本核算、MCP 工具边界和可观测性。
03 · Multi-Agent Shared Memory
围绕 Agent 共享上下文、记忆抽取、存储、检索、冲突和隔离,验证不同 Agent 框架如何通过统一的 WebSocket/HTTP/数据库边界协同。
可讨论: 记忆新鲜度、错误记忆纠正、家庭成员隔离、敏感字段遮蔽、降级和回滚。
04 · AI Gateway / Quota / Cost
通过自托管看板和 Provider adapter 统一观察模型额度、成本、请求状态和失败原因。
边界: 只使用本人合法授权的凭据;不保存 Cookie,不绕过服务端限制,不抓取他人会话;密钥仅来自环境变量或 Secret Store。
05 · Observability and Recovery
把日志、指标、链路、事件时间线、容量和故障复盘串成证据链,而不是只展示一张“服务正常”的截图。
可讨论: P95/P99 延迟、重试风暴、熔断/降级、消息堆积、Worker 崩溃恢复、告警噪声和容量管理。
How I Work
- 先定义边界:身份、权限、数据、失败模式和回滚路径。
- 再做平台化:Provider abstraction、统一契约、幂等、限流、降级和版本治理。
- 最后做证据闭环:日志、指标、追踪、测试、容量、成本和故障复盘。
Last updated: August 21, 2026 · Personal portfolio, not an employer statement.