feat(overlay): 覆盖网络线 序㊾ —— 探针观测面改「两台中继并集」(附 序㊽ 源码/文档补提交)
序㊾(本棒):
- scripts/overlay-probe.cjs:OBS-01 / OBS-08 / OBS-09 的数据源由「只读 47 中继」
改为「按两台中继取并集」,消除 worker 归属漂移时的假红 / 假 SKIP
· endpoints 以 network:hostId:port 为键合并,online 取「或」、localPort 取在线那一侧
· used 按 network/hostId 去重计数(不求和,避免凭空放大在册数)
· localPort 属中继机回环落点 ⇒ 按归属分机探活(106 侧落点由 106 机上探)
· derived(OBS-11)保持 47 视角;阈值与判据一律未放宽
· OBS-16 计数约束:对 47 /status 的读取仍为三次、Δ 只取 47 的 counters;
对端 106 的采样为独立一次,落在第三次采样之后,不进 (status2, status3] 门窗口
· 新增 --peer-status-fixture(并集的对端那一半)与「并集不可取证」强制留痕
- 交接单《覆盖网络-序45-低熵块治理-测熵与实现》§16 全节(§8 前前缀逐字未变)
- 参数表 §11.16 补记(§10 现算指纹未变,值格未动)
附(前几棒已完成并已部署、但尚未入仓的源码 / 文档):
- src/net/relay/content/*.ts、src/net/relay/index.ts、main.ts:块级寻址 C 域分离
- src/supervisor/orchestrator.ts、src/worker/agent.ts:日志采集与巡检(方案 C)
- test/overlay-content.test.mjs:随附用例(npm test = 200 pass / 0 fail / 1 skipped,Node 22)
- scripts/dshlog.mjs(跨机日志取证)、scripts/overlay-entropy.cjs(熵探针)
- dsh-server-docs/04-调整方案/129、133;INDEX.md / docs-manifest.json / 交接单 README 登记
This commit is contained in:
1 parent
45b4999d24
commit
d2ef362a98
20 files changed
+2998
-183
No files matched your search
@@ -1,9 +1,9 @@
|
||||
---
|
||||
name: dsh-instance-diagnose
|
||||
description: DSH 多租户平台(alotbuy.com / 47.77.182.89)单个用户实例的「故障诊断」技能,重点是内存 / OOM / 实例崩溃重启。当出现「实例打不开」「会话突然报错/中断」「跑着跑着断了」「响应慢」「怀疑内存不够」时触发。核心:先分「服务级 / 实例级 / 会话级」三层定位,再用 cgroup 内存三件套定量归因,最后在隔离 cgroup 里复现——**绝不在生产实例上做压力测试**。
|
||||
version: 1.0.0
|
||||
updated_at: 2026-09-12
|
||||
last_change: 首版。由 2026-09-12 guest 实例 OOM 排查沉淀(两个会话同一秒被打断 → 内核 OOM 杀 node → exitCode 137),含 cgroup v1 路径、两条死亡路径区分、隔离复现配方与 6 条实测踩坑。
|
||||
description: DSH 多租户平台(alotbuy.com / 47.77.182.89)单个用户实例的「故障诊断」技能,重点是内存 / OOM / 实例崩溃重启。当出现「实例打不开」「会话突然报错/中断」「跑着跑着断了」「响应慢」「怀疑内存不够」时触发。核心:先做第 0 层「跨机日志取证」(dshlog),再分「服务级 / 实例级 / 会话级」三层定位,再用 cgroup 内存三件套定量归因,最后在隔离 cgroup 里复现——**绝不在生产实例上做压力测试**。
|
||||
version: 1.1.0
|
||||
updated_at: 2026-09-18
|
||||
last_change: 2026-09-15:死亡路径由 2 条扩到 4 条 —— 新增 C(bwrap 挂载点被嵌套 tmpfs 遮蔽(`Can't chdir to <正常路径>`))与 D(迁移复现不了启动参数(`Can't chdir to :` 空路径)),含分诊判据与「中间目录必须统一前置」的修法。
|
||||
agent_created: true
|
||||
---
|
||||
|
||||
@@ -28,6 +28,24 @@ agent_created: true
|
||||
|
||||
## 三层定位(按顺序做,每层都能单独结案)
|
||||
|
||||
### 第 0 层 · 跨机日志取证(**先做这一层** —— 2026-09-18 加)
|
||||
|
||||
**遇到"线上跑着跑着不对"但说不清哪一层时,先用 `dshlog` 把 47 / 106 的 journald 拉回本机再判**:跨机、跨单元、带毫秒时间线,比逐台 `journalctl` 快一个量级。
|
||||
|
||||
```bash
|
||||
N="E:/ProgramData/.workbuddy/binaries/node/versions/22.22.2-3/node.exe"
|
||||
$N scripts/dshlog.mjs collect --since 6h # 拉取(之后再用就不带 --since,走 cursor 增量)
|
||||
$N scripts/dshlog.mjs watch --since 1h # 巡检:8 条规则出判据表,有 FAIL ⇒ rc=2
|
||||
$N scripts/dshlog.mjs q "/EADDRINUSE|OOM/" --since 24h
|
||||
$N scripts/dshlog.mjs timeline --from 2026-09-18T20:00 --grep "overlay" --out /tmp/tl.log
|
||||
```
|
||||
|
||||
⚠️ **三条必知**(细节见 `04-调整方案/129-日志采集与巡检-方案C实现.md`):
|
||||
|
||||
- 🔴 **`ssh -C` 是硬前提**:47 出方向未压缩实测 ~20 KB/s(1.6 MB 要 84 s),开压缩后 11 s。不加会**看起来像卡死**。
|
||||
- 🔴 **实例层(`dsh --profile`)的 stdout 不进 journald**(`_SYSTEMD_UNIT=…scope` 与 `_PID=` 均为空,已双重取证)⇒ **`dshlog` 拿不到实例自己的日志**,只有 Worker 转发的部分。要实例层证据仍须按下面第 2 层**上机取 cgroup / proc**。
|
||||
- 📌 归档在 `E:/dsh-logs/`(本机 E 盘,不在仓库内);`prune --keep N` 管保留。
|
||||
|
||||
### 第 1 层 · 服务级
|
||||
|
||||
```bash
|
||||
@@ -76,14 +94,23 @@ find <用户根>/home/sessions -name session.jsonl.zstd -printf "%TY-%Tm-%Td %TH
|
||||
|
||||
**别忘了对照**:多实例时横向比 `dsh-instance-mem.log`(**时间戳是 UTC,+8 才是本地时间**)。无插件的实例峰值 vs 有插件的实例峰值 = 插件的净增量。
|
||||
|
||||
## 两条死亡路径(症状不同,别混)
|
||||
## 四条死亡路径(症状不同,别混)
|
||||
|
||||
| 路径 | 触发 | 日志指纹 | systemd 结果 |
|
||||
|---|---|---|---|
|
||||
| **A · V8 堆限** | 堆冲到 `--max-old-space-size` | `FATAL ERROR: Reached heap limit` / `Ineffective mark-compacts` | `code=dumped/status=ABRT` |
|
||||
| **B · cgroup 限** | RSS 打满 `MemoryMax` | `kernel: oom-kill:constraint=CONSTRAINT_MEMCG, task=node` | `code=killed/status=9/KILL` → 平台 `exitCode 137` |
|
||||
| **C · bwrap 挂载点被遮蔽**(2026-09-15 新增) | bwrap 参数里**同时绑多个路径且它们嵌套在同一前缀下**(如"用户根" + "共享技能层")。后挂的 `--tmpfs <共同祖先>` 会把**已绑好的挂载点整个遮掉** | `bwrap: Can't chdir to <userRoot>/ws/xxx: No such file or directory` —— ⚠️ **路径看起来完全正常**,极易误判成"目录没建" | 子进程 `exitCode 1` → 平台按崩溃退避重启 → 5 次后**熔断**(10 min 冷却) |
|
||||
| **D · cwd 为空**(2026-09-15 新增) | 启动参数里 `folder` 为空/`null`(**跨机迁移**时最容易:复现不了原启动参数) | `bwrap: Can't chdir to : No such file or directory` —— ⚠️ **路径是空的**(一眼可辨) | 同上 |
|
||||
|
||||
**两条都拿不到可读的应用层日志**——这正是用户觉得「莫名其妙就断了」的原因。
|
||||
**A/B 拿不到可读的应用层日志**(这正是用户觉得"莫名其妙就断了"的原因);**C/D 反而有明确日志** ⇒ 见到 `Can't chdir` 直接分诊:
|
||||
|
||||
- **路径是空的** ⇒ **D**:查实例记录 / 迁移入参里的 `folder` 是不是 NULL。
|
||||
📌 集群模式下实例行是 `claimInstance` 建的(local 模式不写库),**它必须把 `folder`/`patch` 一并落库**,否则迁移时无处取得启动参数。
|
||||
- **路径正常却报不存在** ⇒ **C**:看 `orchestrator.ts` 的 bwrap 参数里,**中间目录是不是"就近创建"的**(例如插在 `--bind root root` 之后)。
|
||||
✅ 正确做法:**所有挂载点的中间目录统一前置 + 去重 + 由外到内**,禁止插在任何一个 `--bind` 之后。
|
||||
- 最小复现(**别拿生产实例试**):`bwrap <与平台等价的参数> -- /usr/bin/ls -ld <那个路径>`,再逐条增删参数二分。
|
||||
⚠️ 顺带记住:需要给挂载点权限时只能用 `--tmpfs`(自带 0755),**不能用 `--perms`** —— 47 上 bwrap 是 0.4.0,不认该选项。
|
||||
|
||||
## 隔离复现(**唯一允许的压测方式**)
|
||||
|
||||
|
||||
Reference in new issue
Block a user