01 · 机器人云平台迁移到 AI Platform
长期负责机器人云平台的 OpenAPI、设备状态、任务调度、异步处理、幂等、恢复和生产可观测性。对应到陪伴机器人 AI Platform,重点是把设备身份、会话状态、工具调用、模型路由、长期记忆和故障恢复组织成统一的平台边界。
可讨论:多租户、设备/家庭成员隔离、状态一致性、断线重连、权限和高风险动作确认。
面向 AI 平台、机器人云、Agent 工程化和分布式系统岗位的个人实验室与开源项目整理。
长期负责机器人云平台的 OpenAPI、设备状态、任务调度、异步处理、幂等、恢复和生产可观测性。对应到陪伴机器人 AI Platform,重点是把设备身份、会话状态、工具调用、模型路由、长期记忆和故障恢复组织成统一的平台边界。
可讨论:多租户、设备/家庭成员隔离、状态一致性、断线重连、权限和高风险动作确认。
Provider-neutral 的 AI 内容流水线,覆盖 Planner、Shot、Queue、Worker、Provider、Storage 和 Render。
可讨论:任务幂等、Worker lease、超时/重试、Provider 限流、TTS/视频异步任务、成本核算、MCP 工具边界和可观测性。
围绕 Agent 共享上下文、记忆抽取、存储、检索、冲突和隔离,验证不同 Agent 框架如何通过统一的 WebSocket/HTTP/数据库边界协同。
可讨论:记忆新鲜度、错误记忆纠正、家庭成员隔离、敏感字段遮蔽、降级和回滚。
通过自托管看板和 Provider adapter 统一观察模型额度、成本、请求状态和失败原因。
边界:只使用本人合法授权的凭据;不保存 Cookie,不绕过服务端限制,不抓取他人会话;密钥仅来自环境变量或 Secret Store。
把日志、指标、链路、事件时间线、容量和故障复盘串成证据链,而不是只展示一张“服务正常”的截图。
可讨论:P95/P99 延迟、重试风暴、熔断/降级、消息堆积、Worker 崩溃恢复、告警噪声和容量管理。