四份主力资金数据数值相似度对比分析
对东财、同花顺、钱龙、钱龙L2 四份数据源共 5000 余只 A 股的主力资金数值进行统一归一化与逐股匹配,从数值相似度维度量化四源差异。
1核心结论
四份数据虽同称"主力资金",但数值相似度整体偏低,口径并不一致。
(东财 vs 钱龙)
(差于随机抛硬币)
东财净流出 vs 同花顺净流入
Pearson 仍仅 0.25
最相似的一对是 东财 vs 钱龙(Pearson 0.60、Spearman 0.52、符号一致率 69%),但也仅达中等相关;其余各对 Pearson 普遍低于 0.30,部分对子的涨跌方向一致率甚至不足 50%。这表明四份数据对"主力资金"的统计口径(大单阈值、计算方法、覆盖范围)存在系统性差异,数值之间不具备直接可比性。
2数据概览与清洗
四源原始单位与代码格式各异,统一归一化为"亿元"并按 6 位股票代码匹配后进行对比。
2.1 各源统计(统一为亿元)
| 数据源 | 有效股票数 | 最小值 | 最大值 | 均值 | 中位数 | 标准差 | 全市场合计 |
|---|---|---|---|---|---|---|---|
| 东财 | 5,271 | -22.51 | 34.54 | -0.023 | -0.001 | 0.958 | -119.47 |
| 同花顺 | 5,193 | -23.52 | 54.08 | 0.203 | 0.035 | 1.382 | 1,052.48 |
| 钱龙 | 5,324 | -14.94 | 22.04 | 0.037 | 0.002 | 0.700 | 195.65 |
| 钱龙L2 | 5,305 | -24.89 | 133.79 | 0.152 | 0.000 | 3.384 | 808.52 |
口径差异的直观信号
同一天的全市场主力资金合计,东财为 -119 亿元(净流出),而同花顺为 +1052 亿元、钱龙L2 为 +809 亿元(净流入)。方向相反、量级相差近 9 倍,是四源口径不一致的最直接证据。
2.2 数据清洗要点
对比前对四份原始文件做了如下归一化处理,以保证"同股同量纲"匹配:
- 东财:原始单位为"元",统一 ÷1e8 转为亿元;股票代码 6 位,无重复。
- 同花顺:原始值混用"亿/万"两种后缀(332 个亿、4856 个万、5 个无后缀),分别按亿、÷1e4、÷1e4 换算为亿元。
- 钱龙:原始为亿元,但存在 132 个重复代码(多为"一个真值 + 一个 0 占位"),去重时优先保留非零值。
- 钱龙L2:股票代码带 SH/SZ 前缀,统一去除前缀补齐 6 位;单位为亿元,去 1 个重复。
3相似度总览
以下热力图展示四源两两的 Pearson 相关系数。颜色越深(越蓝)表示线性相关越强。
4全市场口径差异
将每源所有股票的主力资金求和,可直观看出四源对"全市场主力净流向"的判断分歧。
5重点组合散点对比
每张散点图的横纵轴为两个数据源的同股主力资金值(亿元,已裁剪至 ±15 亿区间便于观察密集区)。点越集中于对角线,相似度越高。
东财 vs 钱龙(最相似)
东财 vs 同花顺
钱龙 vs 钱龙L2(同厂商)
同花顺 vs 钱龙L2
东财-钱龙散点呈较明显的正相关带状分布;东财-同花顺散点则高度发散、几乎看不出线性关系;即便是同一厂商的钱龙与钱龙L2,散点也严重发散——说明 L2 版本采用了与基础版不同的统计口径。
6完整相似度指标矩阵
下表列出六对组合的全部相似度指标。绿色标注该指标下的最优对,红色标注最差对。
| 数据对 | 共有股票 | Pearson | Spearman | R² | CCC 一致性 | MAE(亿) | RMSE(亿) | 符号一致率 | 中位相对误差 |
|---|---|---|---|---|---|---|---|---|---|
| 东财 vs 同花顺 | 5,193 | 0.258 | -0.020 | 0.067 | 0.238 | 0.405 | 1.484 | 0.490 | 2.00 |
| 东财 vs 钱龙 | 5,193 | 0.596 | 0.515 | 0.355 | 0.567 | 0.178 | 0.789 | 0.693 | 1.08 |
| 东财 vs 钱龙L2 | 5,271 | 0.272 | 0.052 | 0.074 | 0.263 | 0.245 | 1.346 | 0.381 | 2.00 |
| 同花顺 vs 钱龙 | 5,193 | 0.080 | 0.186 | 0.006 | 0.064 | 0.346 | 1.510 | 0.557 | 1.80 |
| 同花顺 vs 钱龙L2 | 5,193 | 0.106 | 0.555 | 0.011 | 0.105 | 0.310 | 1.764 | 0.572 | 1.63 |
| 钱龙 vs 钱龙L2 | 5,196 | 0.248 | 0.212 | 0.062 | 0.149 | 0.199 | 2.064 | 0.437 | 2.00 |
指标解读:Pearson 衡量线性相关,Spearman 衡量秩(单调)相关,CCC 同时考察精度与准确度(越接近 1 越一致),符号一致率 反映涨跌方向判断的吻合度,MAE/RMSE 为绝对误差(亿元)。
7关键发现与结论
整体相似度偏低,仅一对达中等相关
六对组合中只有"东财-钱龙"Pearson 超过 0.5(0.60),其余五对均低于 0.30,"同花顺-钱龙"甚至低至 0.08,几无线性关系。
涨跌方向经常不一致
"东财-钱龙L2""钱龙-钱龙L2""东财-同花顺"三对的符号一致率分别为 38%、44%、49%,均低于 50%——意味着对同一只股票,两源连资金是净流入还是净流出都常常判断相反。
全市场净流向方向相反
东财判定全市场主力净流出 119 亿元,而同花顺、钱龙L2 判定净流入超 800 亿元。这种方向性矛盾无法用随机误差解释,只能源于统计口径差异。
同厂商未必更相似
钱龙与钱龙L2 出自同一厂商,Pearson 却仅 0.25,远低于跨厂商的"东财-钱龙"(0.60)。L2 版本显然改用了不同的主力资金算法(如基于 Level-2 逐笔委托的大单口径)。
秩相关与线性相关脱节
"同花顺-钱龙L2"Spearman 高达 0.55 但 Pearson 仅 0.11,说明两源在"哪些股票资金更强"的排序上有一定共识,但在具体数值量级上严重背离。
总结论
四份"主力资金"数据在数值层面相似度较低、口径互不统一。跨源数值不可直接替换或平均;若需做多源融合,建议先以某一源为基准做分位数/秩对齐,而非直接做数值加权。在所有源中,"东财"与"钱龙"的口径相对接近,可作为互相校验的首选组合。
8方法说明
匹配方式:以 6 位股票代码为键,对四源做外连接;每对组合仅取两源均有有效值的股票参与该对的相似度计算。
单位归一化:东财"元"÷1e8、同花顺"亿/万"分别换算、钱龙与钱龙L2已是亿元。
指标定义:Pearson = 线性相关系数;Spearman = 秩相关系数;R² = Pearson²;CCC = Lin 一致性相关系数 2·cov/(sx²+sy²+(mx-my)²);MAE/RMSE = 平均/均方根绝对误差(亿元);符号一致率 = sign(x)==sign(y) 的比例;中位相对误差 = median(|x-y|/((|x|+|y|)/2)),2.0 表示该对超过半数股票相对误差已达上限。
散点图:为避免极端值压扁视觉,散点裁剪至 ±15 亿元区间并随机抽样约 600 点;不影响相关性结论。