Denoise(去噪)

定义

去噪就是从被随机干扰污染的观测数据中,尽量还原出干净的原始信号。信号处理里把观测建模为真实信号与噪声之和:

y = x + n

  • y:实际拿到的、含噪的数据
  • x:想要还原的干净信号
  • n:混入的随机噪声(常假设为高斯噪声)

Denoise 即从 y 估计 x,等价于去掉 n。

噪声来源

  • 成像:光照不足、传感器热噪声、量化误差
  • 音频:环境杂音、电路底噪
  • 传输:信道干扰
  • 科学测量:仪器精度限制

方法谱系(由传统到现代)

  1. 多帧平均:同场景多次采样,随机噪声正负抵消,均值逼近 x。信噪比随帧数 √N 提升。
  2. 空间平滑:均值/中值/高斯/双边滤波,用邻域信息压抑孤立异常点。缺点是易糊边缘(双边、非局部均值 NLM 缓解此问题)。
  3. 变换域:小波/傅里叶变换后,噪声多落在高频,做阈值收缩再逆变换。
  4. 稀疏 / 字典:假设干净信号在某字典下稀疏(如 K-SVD、BM3D),噪声不稀疏,据此分离。
  5. 深度学习:用「干净—含噪」配对训练网络(DnCNN 等),直接学噪声或残差映射,效果与鲁棒性目前最优。

与扩散模型的关系(重点)

现代生成模型 DDPM(Denoising Diffusion Probabilistic Models)把「去噪」推到极致,成为生成新数据的核心:

  • 前向过程:对干净图 x₀ 逐步加高斯噪声,T 步后变成近似纯噪声 x_T(雪花点)。
  • 反向过程:训练一个网络 εθ 在每一步预测「这一步加了什么噪声」,从而一点点去噪,从纯噪声 x_T 反推回 x₀。
  • 训练目标:本质是让网络学会「给定含噪图和噪声等级 t,预测其中的噪声 ε」——一个逐级 denoise 任务。
  • 生成:推理时从随机噪声出发,反复调用去噪网络若干步,「变」出一张全新样本。

所以扩散模型的一句话理解就是:把生成问题转化为「学会分步去噪」。Stable Diffusion 在此基础上把去噪放到潜空间(latent),并用 cross-attention 注入文本条件,实现文生图。

对 OCR 研究的启发

  • 文档图像预处理去噪(去扫描噪点、去背景)可提升前端检测/识别稳定性。
  • 扩散式「迭代精修」思想可借鉴到结构化输出的逐步修正;条件去噪 + cross-attention 是「视觉条件下生成结构化文本」的通用范式,与后端 AR 生成路线相通。

一句话

Denoise = 擦掉数据上的随机脏点、还原本来干净的样子;从手机拍照修复到 AI 文生图(ddpm),背后都是它。

相关:ddpm、cross-attention、residual-connection。