MAX APIMAX API
使用指南部署安装API 参考AI 应用帮助支持商务合作合规与使用政策
⚠️合规提示:本项目仅用于合法授权的 API 网关、内部管理和私有化部署场景。请遵守上游服务条款、平台规则、监管要求和内容安全要求。
管理员指南

系统信息与实例

查看多节点实例状态并清理失联实例记录

系统信息页面面向 Root 管理员,用于查看多节点部署中的实例状态、资源使用情况和系统任务。可从个人菜单进入「系统信息」,或直接访问 /system-info

公开健康检查

平台提供三个无需登录的 GET 端点,供 Kubernetes、负载均衡器和外部监控使用:

端点用途成功响应
/health通用服务存活检查,兼容只需要单一健康 URL 的监控系统HTTP 200{"success":true,"status":"ok"}
/health/liveLiveness;仅确认进程仍能处理 HTTP 请求,不探测数据库HTTP 200{"success":true,"status":"ok"}
/health/readyReadiness;每次请求都会执行数据库连接探测HTTP 200{"success":true,"status":"ready"}

数据库探测失败或超时时,/health/ready 返回 HTTP 503

{
  "success": false,
  "status": "unhealthy",
  "message": "database connection failed"
}

客户端只会收到通用消息,具体数据库错误保留在服务端日志中。编排系统应使用 /health/live 决定是否重启容器,使用 /health/ready 决定是否把实例加入流量;不要解析需要管理员权限的系统信息接口来代替 readiness。

livenessProbe:
  httpGet:
    path: /health/live
    port: http
readinessProbe:
  httpGet:
    path: /health/ready
    port: http

实例状态

实例列表显示节点名称、角色、版本、启动时间、最后心跳时间和资源状态。实例默认每 30 秒上报一次状态;最后心跳时间早于当前时间 90 秒的记录会标记为失联(stale)。

建议为每个节点配置稳定且唯一的 NODE_NAME,这样在滚动更新或排查异步任务时能够持续识别同一实例。

清理失联实例

仅 Root 管理员可执行删除操作。

  1. 在「系统信息 -> 实例」中确认需要清理的失联记录。
  2. 删除单个记录时,在线或仍在失联阈值内的实例会被后端拒绝删除。
  3. 使用「删除所有失联」可一次性清理全部失联记录;确认后列表会自动刷新。

批量删除只会处理 last_seen_at 早于当前时间减去失联阈值的记录。在线实例以及正好处于阈值边界的实例不会被删除。执行期间刷新和单实例删除会被暂时禁用,以避免重复操作。

管理接口

系统提供 Root 权限接口 DELETE /api/system-info/stale-instances。成功响应的 data.deleted_count 表示本次实际删除的记录数。该操作复用现有 system_instances 数据,不需要数据库迁移。

清理实例记录不会停止进程、撤销密钥或修改渠道配置。若节点仍在运行,应先排查网络、时钟和心跳上报,再删除过期记录。

这篇文档对您有帮助吗?