fix: DualStream Pipeline 三项修复 — StandardScaler + 部署导出 + 推理拆弹

任务1: Pipeline 插入 StandardScaler
  imputer → FeatureUnion → cleaner → scaler(StandardScaler) → SVR
  MNF(≈1e4量级)与物理指数(≈1e0量级)统一尺度后入SVR

任务2: .npz 导出 scaler_mean / scaler_scale
  C++端可复现 (X - mean) / scale

任务3: 推理端 train_wavelengths 缺失时直接抛异常
  不再静默裸退308列导致 SimpleImputer 维度不匹配崩溃
This commit is contained in:
duxin
2026-07-29 15:41:25 +08:00
parent 7ecdf6a2a0
commit 3edb73b652
2 changed files with 12 additions and 3 deletions

View File

@ -646,7 +646,8 @@ class WaterQualityModelingBatch:
('imputer', SimpleImputer(strategy='median')),
('preproc', preproc),
('cleaner', _SafeFiniteTransformer()),
('model', base_model),
('scaler', StandardScaler()),
('model', base_model),
])
# ★ 入口清洗inf → NaN后续 SimpleImputer/cleaner 接力处理
@ -785,6 +786,11 @@ class WaterQualityModelingBatch:
'mnf_W': np.asarray(_mnf.W_mnf_),
'mnf_n_components': int(getattr(_mnf, 'n_components_', _mnf.n_components)),
}
# StandardScaler 参数C++ 端需复现 (X - mean) / scale
_scaler = model.named_steps.get('scaler')
if _scaler is not None and hasattr(_scaler, 'mean_'):
_deploy['scaler_mean'] = np.asarray(_scaler.mean_, dtype=np.float64)
_deploy['scaler_scale'] = np.asarray(_scaler.scale_, dtype=np.float64)
# SVR 部署矩阵rbf kernel 需要 support_vectors_
_deploy['svr_dual_coef'] = np.asarray(_svr.dual_coef_)
_deploy['svr_intercept'] = np.asarray(_svr.intercept_)

View File

@ -446,8 +446,11 @@ class WaterQualityInference:
"""
train_wl = metadata.get('train_wavelengths', None)
if train_wl is None or len(train_wl) == 0:
print("[DualStream_MNF] ⚠ 模型无 train_wavelengthsfallback 原样输入")
return spectra.values
raise ValueError(
"推理失败metadata 中缺失 train_wavelengths。"
"DualStream_MNF 必须对齐训练波段以完成光谱重采样。"
"请使用包含 train_wavelengths 元数据的模型文件。"
)
# 提取纯光谱列
spec_cols = []