Evidence Boundary
本期是系统反馈,不是 Founder Seed、stable mind、project seed 或公开 claim 的自动更新。
Current facts 来自本地 source、monitor state、Git 状态、报告文件、公开 URL 和 Discord read-back。Inference 只用于判断系统是否变强;proposal 只给 Gong 做下一步选择。
本期最重要的边界:
TabU-lab的多份 diagnostics 是local_unissued,且所在 worktree 大量 dirty/untracked;它们可以证明执行 spine 和候选信号变强,不能进入 accepted claim、benchmark claim、foundation-model claim 或 public release claim。- P35/OAttention 的 release-candidate 仍有 clean source、external submission、red-team fixes 与 NLP-facing gate;本周不能把它说成已提交或已发布。
- Team Dashboard、Research homepage 和 system-reflection pages 是 public projections;它们证明传播和可读性,不替代 canonical source。
- AID/Discord evidence 本周覆盖 active-thread daily wedge,不是全量 Discord/DM。
本周 Verified Deltas
1. System Root / Project Family / Seed Registry
Current fact:FOUNDER_SEED.md、README.md、hello_agent.md 与 system-reflection process 仍然一致:WeHub 是 opinionated AI collaboration / Agent Harness;Discord 是 live feedback and eval grow place;public websites 是 projections;任何 Founder Seed、stable mind 或 accepted claim 的变更都需要 source-backed review。
Current fact:本期 process 仍是 v0.2,要求五类测试:mainline、evolution、human-attention、complexity、representative-work。
Inference:系统根叙事没有漂移。比较强的变化不是“口号更新”,而是更多事项开始按 source/projection/receipt 边界运行。
Risk:如果 TabU-lab 的 local diagnostics 被外部页面或对话误读成 benchmark/release,系统会把 evidence chain 提前截断。
2. Team OS / Hosts / Runtimes / Providers
Current fact:provider monitor 在 2026-08-30 14:43 CST 生成:9/9 hosts reachable,43 robots,363 provider entries;primary usable 42,primary warn/unknown 1,primary down 0;action items 0,policy action items 32。
Current fact:agent access surface 同时显示 43/43 profiles reachable or configured,attention_total 0;Hermes 19,OpenClaw 24。
Current fact:runtime watchdog 在 2026-08-30T19:16:03+08:00 显示 dgx1、dgx2、dustinstudio、ghy、wehub up;local WeHub OpenClaw ready,weshare Hermes gateway running,dgx2 Discord proxies ok,Gong slash auth ok。
Current fact:token monitor 的 public URL 是 https://wehub.us/token/,cron job b2512ef7dfc0 每 30 分钟刷新。2026-08-30 早段多个点因 partial/unverified snapshot 与 invalid_regressions=1 被拒绝,没有进入 public series;同日 20:00 自动刷新成功,snapshot total 593913850,10 hosts,dashboard/logic/codex-direct/resource 生成并 deploy 到 dgx2/dgx1。
Inference:这不是 token 使用量本身的进步,而是 monitor 的 fail-closed 和自动恢复链条更可信:坏点被拒绝,好点重新进入 public series。
Risk:policy mismatch 仍有 32 项;这不是 P0 incident,但说明 provider policy registry 还没完全收敛。
3. Discord / AID / Human Attention
Current fact:daily-discord-history-evidence.json 覆盖 2026-08-29 active-thread daily wedge,usable Gong messages 4。核心信号包括:
- Gong 明确提出
table cell与table row作为 Unit 都很重要,model factory 每个模型要考虑两种 Unit 设计。 - Gong 给出六层 evaluation ladder:component correctness、decoupling/extensibility/growability、synthetic fit、real prediction、synthetic pretraining + ICL、synthetic pretraining + real-task fine-tune lift。
- Gong 要求不要只给当前答案打补丁,而要把逻辑自然融入 source design。
Inference:人类注意力本周没有停留在 status chasing,而是进入了 model-family semantics、evaluation ladder 与 source integration。这是研究系统变强的正向信号。
Risk:coverage 是 active-thread wedge,不是全 Discord/DM;不要据此判断所有人类注意力都被正确吸收。
4. Nano-work
Current fact:nano-work inspection 在 2026-08-30T15:16:18 生成:295 source files,233 indexed,classified 295/295,invalid 0,explicit-ignore 1;idea 36,project 49,task 148;doing tasks 23。相对 2026-08-23 的 284 source files / 222 indexed,增长 11。
Current fact:新增/更新重点包括:
/Users/cms/.openclaw/workspace/nano-work/projects/2026-08-26-tabu-lab-公开表格基座开放实验室.md/Users/cms/.openclaw/workspace/nano-work/projects/2026-08-26-wehub-智能体框架长期调研空间.md/Users/cms/.openclaw/workspace/nano-work/ideas/2026-08-24-gong-2026-08-23-三条表格大模型推进信号.md/Users/cms/.openclaw/workspace/nano-work/ideas/2026-08-24-p35-null-token-presence-level-随机-dropout-假设.md/Users/cms/.openclaw/workspace/nano-work/tasks/TASK-20260830-001-daily-task-board.md
Current fact:TabU-lab nano card 在 2026-08-30 订正:tabu.unit_row 和 tabu.unit_pair 是 independent contracts/families,不是 aliases 或 unit_kind variants;共同 authority 是 upper research protocol,不是 model identity。
Inference:nano-work 不是只增加文件数量,而是把 Gong 的语义纠偏、六链 evaluation 和 public-lab gate 放进了可持续 carrier。
Risk:doing tasks 23 偏高;如果不压 WIP,TabU-lab、P35、10 Paper、agent-frameworks 会互相拖慢。
5. WeHub Agent Mind
Current fact:本期 canonical source 写入 /Users/cms/wehub-agent-mind/feedback-observations/2026-08-30-wehub-weekly-system-reflection.md,并将由 Team Dashboard system-reflection projection 渲染。
Inference:Agent Mind 本周最该保存的不是“更多项目”,而是一个判断:WeHub 现在更像 evidence-gated research OS,而不是一组并行 bot/script。
Proposal only:stable mind 可以候选更新为“TabU-lab 是 Unit-as-primitive research program 的公开实验室 carrier;它接受 local_unissued diagnostics,但不接受未经 review 的 public claim。”
6. Skills API Flywheel
Current fact:本周没有看到 Skills API Flywheel 进入新的 accepted release 或正式 public contract evidence。
Inference:技能系统的主要贡献仍是作为操作协议和 routing memory,帮助 WeHub 避免把 WeHub、public deploy、Discord workspace、agent dispatch 当成普通脚本任务。
Risk:如果技能增长只沉淀为 instruction,而没有 replayable validation 或 live grow-place readback,它会变成隐性复杂度。
7. Causal Superintelligence / Causality Primer / Causal Intelligence
Current fact:causal-superintelligence/TabU/tabu-lab 本周是 causality/Unit 方向的主增量;它通过 model contract registry、eval chain、reports 和 public lab projection 把 Unit-centered learning 从想法推进到可执行实验室结构。
Current fact:Research homepage 已重建,canonical source 在 /Users/cms/wehub-system-msp/projects/wehub-research-homepage,本地 verifier 通过:required files、language pages、ids、links、marker wehub-research-home-v20260826-01,并保留 “TabU remains a wedge; lab_bootstrap evidence boundary”。公开 https://research.wehub.us/ 可见 WeHub Research、causal intelligence、Unit learning、TabU-lab 与 “public artifacts as projections” 边界。
Inference:长期研究叙事更清楚了:causal intelligence 是上位问题,TabU-lab 是 Unit-centered learning wedge,public homepage 是 projection,不是 source authority。
Risk:Causality primer / public narrative 若继续扩张,必须保持 TabU ≠ TabUF、Unit ≠ Unit token、response law ≠ causal identification 的边界。
8. 10 Paper Portfolio / P11 / P35 / TabU-lab
TabU-lab
Current fact:TabU-lab 位于 /Users/cms/wehub-system-msp/causal-superintelligence/TabU/tabu-lab,真实路径经 symlink 指向 /Users/cms/.openclaw/workspace/projects/causal-superintelligence/TabU/tabu-lab。
Current fact:本周 Git log 包括 model factory kernel、public lab、research execution spine、final snapshot review、release verification gaps、synthetic-to-real transfer v1 protocol 与 fit-first budget diagnosis。HEAD 见 3502fdd docs: propagate fit-first budget diagnosis。
Current fact:model contract registry 已明确:
tabu.unit_row与tabu.unit_pair不是 aliases。- 选择不同 Unit contract 会改变 Unit semantics、carrier shape、token roles、dynamics 与 readout。
- maturity 从
design_open到evidence-backed分级;supported/evidence-backed需要 immutable Gate 1 receipt、independent review、Gong approval 等。
Current fact:eval chain for [email protected] 已定义六链:component correctness、decoupling/extensibility/growability、synthetic fit、real-data prediction、synthetic pretraining and ICL、synthetic pretraining and real fine-tune lift。当前 runner 是 bounded local diagnostic,不下载、不训练、不发 formal receipt、不产生 total score。
Current fact:tabubase-0.2.0-diagnostic.json 显示 link 1/2/3 通过,link 4 real_data_basic_prediction blocked,link 5/6 schema/budget smoke 通过;verification_scope 是 bounded local diagnostic。
Current fact:tabubase-expanded-synthetic-pretraining-2026-08-30.md 给出 expanded synthetic v4 的正向 synthetic held-out AULC、real-data low-shot macro AULC 与参数 hash 不变证据,但明确是 local_unissued,worktree dirty/untracked,不能作为 formal receipt。
Current fact:tabubase-real-full-context-frozen-icl-2026-08-30.md 显示 12 个 real datasets full-context frozen ICL:expanded v4 描述性 pooled primary metric 优于 original PT-S1,但分类不广泛胜过 MLP/XGBoost;regression 只在 Diabetes、QSAR Fish 等局部有竞争力。
Current fact:tabubase-cached-openml-regression-8-finetune-2026-08-30.md 显示 synthetic PT-S1 initialization 在 8 个 OpenML regression datasets 中 7/8 降低 mean scaled RMSE vs scratch,但多数 baseline 仍优于它;remote run 在 dgx2/spark-b5b3,Docker wehub/ml-gpu:20260712,仍是 local_unissued。
Inference:这是本周最强的 representative work。原因不是“模型已经赢了”,而是 TabU-lab 从命名/结构争论走到了 contract → diagnostic → report → boundary 的执行循环。
Risk:TabU-lab worktree 很 dirty,存在 200+ tracked modified 和 200+ untracked;如果不先收敛 reviewable changeset,再多跑实验会降低而不是提高可信度。
P35 / OAttention
Current fact:P35 仍有 release-candidate bundle:157 tests、hidden-carrier receipts、arXiv flat archive compile 等;但 PUBLIC_RELEASE.md 明确 git_dirty: true、all_receipts_match_current_source: false,external release gate 仍 open。
Current fact:P35 red-team v2 认为 core claim stands,但列出高优先级问题:zero-presence row_max 极端 bias、DynamicViT/ToMe 等 prior work positioning、OTransformer presence read after LayerNorm、TabPFN runner second implementation / denominator eps drift。
Current fact:BlackboxNLP ARR candidate 有 architecture interpretability fit,但若无 NLP host study 或 organizer confirmation,不适合 honest NLP full-paper;OpenReview ARR commitment 也需要 ARR paper link,目前未找到。
Inference:P35 本周的正确状态是 red-team hardening 和 external-submission deferral,不是 release exit。
Risk:P35 如果继续被当成“已经可以投”的项目,会压缩 TabU-lab 的 clean changeset 与 formal receipt 节奏。
P11 / TabUF / 10 Paper
Current fact:10 Paper repo 本周有大量 P11/P35/USL dirty changes;d0fbe79 修复 legacy checker 并恢复 English contract blocks,但仍不能代表 clean full-paper gate exit。
Inference:P11/TabUF 的价值正在被 TabU-lab 的 Unit-as-primitive route 重新吸收;当前更该保留为 portfolio context 与 comparison pressure,而不是强行推出 full paper。
Risk:public/reference/projection 增长若超过 receipt 速度,会让 portfolio 看起来变强,实际 evidence density 下降。
Five Required Tests
Mainline Test
Question:本周工作是否推进 WeHub 主线,而不是散点任务?
Verdict:Pass with boundary。
Evidence:TabU-lab 直接推进 “Unit as primitive / causal intelligence / evidence-gated research OS” 主线;Team OS 和 token monitor 支撑可派工与可审计;research homepage 把主线公开表达为 causal intelligence、Unit learning 和 human-agent systems。
Boundary:P35、P11、agent-frameworks 都还没有 clean external gate。
Evolution Test
Question:WeHub 是否比 2026-08-23 更能自我修正?
Verdict:Pass。
Evidence:TabU-lab 明确订正 tabu.unit_row 与 tabu.unit_pair 的身份边界;real frozen ICL report 在 2026-08-30 订正此前 full-context 误读;token monitor 拒绝 early invalid points 并在同日自动恢复。
Inference:系统没有只维护漂亮叙事,而是在 source 里保留 correction。
Human-Attention Test
Question:Gong 的真实注意力是否被吸收?
Verdict:Pass, partial coverage。
Evidence:Discord/AID 把 Gong 对 cell/row Unit、六链 evaluation 和 source design integration 的要求吸收到 nano card、TabU-lab contracts 和 daily task board。
Boundary:AID evidence 不是全量覆盖,不能证明所有 owner intent 都被捕获。
Complexity Test
Question:本周复杂度是否换来了真实能力?
Verdict:Mixed。
Evidence:TabU-lab 的 contract/eval/report spine 是有产出的复杂度;token monitor 的 fail-closed accounting 是有价值的复杂度。
Risk:23 doing tasks、policy mismatch 32、TabU-lab/P35/10 Paper dirty worktrees 都说明复杂度正在接近需要强制收敛的区间。
Representative-work Test
Question:哪一件事最能代表 WeHub 本周变强?
Verdict:TabU-lab。
Evidence:它承接 owner semantics、设计 contract、运行 bounded diagnostics、公开 lab projection、保留 local_unissued 边界,并暴露下一步 gate。
Boundary:它还不是 accepted research claim;代表的是 research OS 的执行质量,不是模型 SOTA。
主战役 / WIP 判断
主战役:TabU-lab should be treated as the current representative battle。
理由:
- 它直接连接 Founder Seed 中的 agent-mediated research、Unit-as-primitive 与 evidence discipline。
- 它吸收了 Gong 本周最核心的人类注意力:cell vs row Unit、六链 evaluation、自然融入 source design。
- 它已经有真实 runs、reports、contracts 和 public projection,但还没有被 prematurely promoted。
需要压住的 WIP:
- P35 先走 red-team fixes + clean release/arXiv gate,不要继续扩张 claim surface。
- P11/TabUF 作为 portfolio pressure 和 comparison context,不抢 TabU-lab 的 formal receipt lane。
- agent-frameworks research space 先跑一个同预算 runtime experiment,不变成六个并行调研洞。
Directions 1-3
Direction 1:TabU-lab clean changeset + one formal receipt lane
Next action:先保护 dirty work,再把 cell/row Unit variants、model contract registry、six-chain eval 和 current reports 收敛成 reviewable changeset。选一个非 design_open model,跑一个最小 formal receipt path。
Success condition:source clean enough for review;one receipt can be independently checked;public projection 不多说一层。
Direction 2:P35 red-team closure before external submission
Next action:修 F0-F3 high issues,补 structural prior work positioning,确认 NLP-facing gate 或改走非 NLP full-paper route。
Success condition:git_dirty: false,receipts match current source,strict verifier rerun,owner approval 明确。
Direction 3:Team OS policy mismatch burn-down
Next action:保留当前 9/9 reachable 和 42 usable primary 状态,同时把 32 policy_action_items 做一次分类:真实 mismatch、maintenance-only、registry stale、acceptable fallback。
Success condition:action items 不增加;policy mismatch 从“已知噪声”变成可解释状态。
Stable Mind Delta Candidates
Proposal only,最多三条:
- TabU-lab 是 Unit-as-primitive research program 的公开实验室 carrier;它可以发布 projections,但 accepted claims 必须经过 formal receipt、independent review 和 Gong approval。
- WeHub 的 monitor 成熟度不看 dashboard 是否漂亮,而看坏点是否 fail-closed、好点是否自动恢复、public series 是否可审计。
- P35 的当前正确身份是 release-candidate under red-team hardening,不是 external release complete。
最值得 Gong 判断的问题
本周是否把主战役正式切到 TabU-lab 的 clean changeset + one formal receipt lane,同时把 P35 限定为 red-team closure / clean release gate,直到 P35 的 external submission 条件真正满足?
本期状态摘要
Source generated:yes。
Local verified:yes。render_system_reflection.py、render_website.py、verify_system_reflection.py passed;verifier reported PASS · 2026-08-30 · 8 report(s)。
Public deployed:yes。scripts/deploy_website_surface.sh exited 0;verify_wehub_public_entrances.py exited 0;manual public marker checks passed for https://wehub.us/team-dashboard/、https://wehub.us/team-dashboard/system-reflection/、https://wehub.us/team-dashboard/system-reflection/2026-08-30/。
Discord notified:yes。Message created and read-back verified at https://discord.com/channels/1467236722524950630/1526521491154407474/1543593943348805693。
Canonical source: Agent Mind / feedback-observations / 2026-08-30-wehub-weekly-system-reflection.md