Denoise(去噪)
定义
去噪就是从被随机干扰污染的观测数据中,尽量还原出干净的原始信号。信号处理里把观测建模为真实信号与噪声之和:
y = x + n
- y:实际拿到的、含噪的数据
- x:想要还原的干净信号
- n:混入的随机噪声(常假设为高斯噪声)
Denoise 即从 y 估计 x,等价于去掉 n。
噪声来源
- 成像:光照不足、传感器热噪声、量化误差
- 音频:环境杂音、电路底噪
- 传输:信道干扰
- 科学测量:仪器精度限制
方法谱系(由传统到现代)
- 多帧平均:同场景多次采样,随机噪声正负抵消,均值逼近 x。信噪比随帧数 √N 提升。
- 空间平滑:均值/中值/高斯/双边滤波,用邻域信息压抑孤立异常点。缺点是易糊边缘(双边、非局部均值 NLM 缓解此问题)。
- 变换域:小波/傅里叶变换后,噪声多落在高频,做阈值收缩再逆变换。
- 稀疏 / 字典:假设干净信号在某字典下稀疏(如 K-SVD、BM3D),噪声不稀疏,据此分离。
- 深度学习:用「干净—含噪」配对训练网络(DnCNN 等),直接学噪声或残差映射,效果与鲁棒性目前最优。
与扩散模型的关系(重点)
现代生成模型 DDPM(Denoising Diffusion Probabilistic Models)把「去噪」推到极致,成为生成新数据的核心:
- 前向过程:对干净图 x₀ 逐步加高斯噪声,T 步后变成近似纯噪声 x_T(雪花点)。
- 反向过程:训练一个网络 εθ 在每一步预测「这一步加了什么噪声」,从而一点点去噪,从纯噪声 x_T 反推回 x₀。
- 训练目标:本质是让网络学会「给定含噪图和噪声等级 t,预测其中的噪声 ε」——一个逐级 denoise 任务。
- 生成:推理时从随机噪声出发,反复调用去噪网络若干步,「变」出一张全新样本。
所以扩散模型的一句话理解就是:把生成问题转化为「学会分步去噪」。Stable Diffusion 在此基础上把去噪放到潜空间(latent),并用 cross-attention 注入文本条件,实现文生图。
对 OCR 研究的启发
- 文档图像预处理去噪(去扫描噪点、去背景)可提升前端检测/识别稳定性。
- 扩散式「迭代精修」思想可借鉴到结构化输出的逐步修正;条件去噪 + cross-attention 是「视觉条件下生成结构化文本」的通用范式,与后端 AR 生成路线相通。
一句话
Denoise = 擦掉数据上的随机脏点、还原本来干净的样子;从手机拍照修复到 AI 文生图(ddpm),背后都是它。