核心问题
能否让模型的计算量随每行 active sparse features 和固定 latent bottleneck 增长,而不是随全局 feature vocabulary 或硬编码最大列数崩溃?
研究一个能够处理超高维、动态、不定长稀疏表格特征的表格基础模型;推荐系统是第一个压力测试场景。当前页面记录问题、边界和下一门禁,不代表模型已实现或取得性能结果。
能否让模型的计算量随每行 active sparse features 和固定 latent bottleneck 增长,而不是随全局 feature vocabulary 或硬编码最大列数崩溃?
Perceiver asymmetric bottleneck 是主假设;HyperNetwork 只先作为低秩 adapter / expert routing 的次级假设与消融,不生成整套 dense per-row 参数。
user/session、active feature/item、cell/interaction 只是建模地图。known-ID 推荐是 direct access,不自动等于 Unit Abduction;non-exposure、unknown、zero 和 not-applicable 需要分开。
用 10^4、10^5、10^6 全局特征词表、可变 active counts、新 ID 与 schema drift 构造 sparse episodes,比较 dense padding、sparse token 和 fixed-latent Perceiver 的质量、显存、吞吐与延迟。
P11 保持 semantic feature / Unit-abduction 的广义主线;P05 专门承接动态稀疏输入、无固定 column axis 和推荐式 query inference 的计算 scaling 问题。
如果结果只是 ordinary sparse embedding + MLP,或仍依赖固定 vocabulary / max-width,P05 应停止为独立论文,回流为 P11 的工程压力说明。