管理员指南
系统信息与实例
查看多节点实例状态并清理失联实例记录
系统信息页面面向 Root 管理员,用于查看多节点部署中的实例状态、资源使用情况和系统任务。可从个人菜单进入「系统信息」,或直接访问 /system-info。
公开健康检查
平台提供三个无需登录的 GET 端点,供 Kubernetes、负载均衡器和外部监控使用:
| 端点 | 用途 | 成功响应 |
|---|---|---|
/health | 通用服务存活检查,兼容只需要单一健康 URL 的监控系统 | HTTP 200,{"success":true,"status":"ok"} |
/health/live | Liveness;仅确认进程仍能处理 HTTP 请求,不探测数据库 | HTTP 200,{"success":true,"status":"ok"} |
/health/ready | Readiness;每次请求都会执行数据库连接探测 | HTTP 200,{"success":true,"status":"ready"} |
数据库探测失败或超时时,/health/ready 返回 HTTP 503:
{
"success": false,
"status": "unhealthy",
"message": "database connection failed"
}客户端只会收到通用消息,具体数据库错误保留在服务端日志中。编排系统应使用 /health/live 决定是否重启容器,使用 /health/ready 决定是否把实例加入流量;不要解析需要管理员权限的系统信息接口来代替 readiness。
livenessProbe:
httpGet:
path: /health/live
port: http
readinessProbe:
httpGet:
path: /health/ready
port: http实例状态
实例列表显示节点名称、角色、版本、启动时间、最后心跳时间和资源状态。实例默认每 30 秒上报一次状态;最后心跳时间早于当前时间 90 秒的记录会标记为失联(stale)。
建议为每个节点配置稳定且唯一的 NODE_NAME,这样在滚动更新或排查异步任务时能够持续识别同一实例。
清理失联实例
仅 Root 管理员可执行删除操作。
- 在「系统信息 -> 实例」中确认需要清理的失联记录。
- 删除单个记录时,在线或仍在失联阈值内的实例会被后端拒绝删除。
- 使用「删除所有失联」可一次性清理全部失联记录;确认后列表会自动刷新。
批量删除只会处理 last_seen_at 早于当前时间减去失联阈值的记录。在线实例以及正好处于阈值边界的实例不会被删除。执行期间刷新和单实例删除会被暂时禁用,以避免重复操作。
管理接口
系统提供 Root 权限接口 DELETE /api/system-info/stale-instances。成功响应的 data.deleted_count 表示本次实际删除的记录数。该操作复用现有 system_instances 数据,不需要数据库迁移。
清理实例记录不会停止进程、撤销密钥或修改渠道配置。若节点仍在运行,应先排查网络、时钟和心跳上报,再删除过期记录。
这篇文档对您有帮助吗?