回流池定位
💧 全域数据回流池是什么?
全域数据回流池是元衡天枢体系的数据基座,负责接收、清洗、归档所有上游模型和采集器产生的数据。
- 多源接入 — 支持多路上游模型数据同时接入,标准化处理
- 七道闸结构 — live/history/computed/quarantine/index 五道分区+七道闸校验
- 哈希校验 — 每条数据携带SHA256哈希,防篡改可验证
- 审计溯源 — 完整记录数据来源、产生时间、处理节点,可追溯可回滚
- 热冷分层 — 热数据实时查询,冷数据归档存储,平衡性能与成本
实时数据状态
live_tick
139
实时行情数据(tick级)
热数据
live_quote
577
报价数据(quote级)
热数据
live_signal
4783
信号数据(节点自产+大冒险+业务线)
持续流入
computed
0
计算衍生数据(均线/策略标签)
待激活
✅【实证】数据来源:Node-B 数据池 /api/pool/status 接口,2026-09-13 16:20 SSH登录采集。live_signal每2分钟+6条(节点自产),每5分钟+大冒险平台,每30分钟+业务线推理。
多模型接入配置
🔌 上游数据源接入
✅【实证】当前回流池接入以下上游数据源:
📡 数据采集器(Node-B)
- AKShare — A股/港股/指数数据,东方财富API(限流时回退)
- 腾讯API — A股/港股行情,回退一级(CN=5, HK=3)
- 新浪API — 美股数据,回退二级(US=7)
- 执行频率 — cron每30分钟,root用户
- 脚本路径 — /opt/data_collector/scripts/collect.py
🧠 节点自产(Node-C)
- 6节点自产 — commander/doubao/qwen/deepseek/cpu-api/data-pool
- 执行频率 — cron每2分钟,每节点独立
- 脚本路径 — /opt/ai_bus/nodes/self_produce.py
- 数据类型 — signal分区,含node_id/type/value/hash/ts
⚔️ 大冒险平台(Node-C)
- 6模块 — 陪跑盘/逆向破解/破风者训练/对标系/漏烟监测/数据冻结
- 执行频率 — cron每5分钟
- 脚本路径 — /opt/adventure/runner.py
- 数据类型 — signal+computed分区,冻结文件本地留存
💼 业务线推理(Node-C)
- 3条业务线 — 文创IP/数字业务/自动化流水线
- 执行频率 — cron每30分钟
- 脚本路径 — /opt/ai_bus/business/inference_bridge.py
- 推理引擎 — CPU小模型Qwen2.5-0.5B,延迟~4.2秒
📄 上游YAML配置
✅【实证】8骨髓包裹层配置文件:/opt/marrow_injector/configs/lean_models.yaml,定义8个模型的inference_endpoint、端口、能力域。
🔍【假说】回流池上游yaml配置可能还包含数据源优先级和回退规则,具体内容待读取配置文件确认。
数据生命周期与审计溯源
🔄 数据生命周期
- 接入 — 上游数据源通过POST /api/pool/write写入
- 校验 — 七道闸校验:格式/来源/时间戳/哈希/去重/完整性/权限
- 分区 — 按source分类写入live/history/computed对应分区
- 热存 — live分区热数据,实时查询API
- 归档 — 超期数据转入history分区,冷存储
- 审计 — 全流程记录,出生证签发,可追溯可回滚
🔐 哈希校验与溯源
- SHA256哈希 — 每条数据携带hash字段,基于node_id+timestamp生成
- 来源标注 — source字段标识数据来源(tick/quote/signal/computed/business)
- 时间戳 — UTC+8 ISO格式,精确到微秒
- 节点标识 — node_id标识产生数据的线粒体
- 隔离区 — quarantine分区存放校验失败的数据
- 索引区 — index分区维护数据索引,加速查询
⏳【规划】数据版本回滚与历史对比功能待开发。
存储分层
热数据层
live分区,实时查询API,数据保留最近7天,Node-B本地存储 /data/cloud_reflow_pool/live/
实时查询
冷数据层
history分区,归档存储,超期数据自动转入,保留期限可配置
归档存储
冻结数据层
大冒险平台对抗结果留存,/opt/adventure/data/frozen/,当前24个冻结文件
不可篡改
📍 存储节点划分
✅【实证】
- Node-B 前线 — 主数据存储节点,/data/cloud_reflow_pool/ 七道闸目录,40G磁盘(26%使用)
- Node-C 金库 — 冻结数据存储,/opt/adventure/data/frozen/,59G磁盘(22%使用)
- Node-A 司令部 — 数据聚合查询,不持久化存储,通过API代理访问Node-B
⏳【规划】PostgreSQL数据库(Node-C Docker aequor-pg 5432)可用于结构化数据持久化,当前数据池为文件系统存储。