从Claude隐形水印回望生成式AI时代可信标识

讲者:中国科技技术大学教授,华东南京学院院长,中国网络工程师学会常务理事,中国中央经济学会常务理事,入选国家高层次人才计划。

image-20260918203649455

image-20260918195420177

image-20260918195450073

image-20260918195511521

image-20260918195524822

ChatGPT 输出里偷偷塞零宽字符、特殊 Unicode 字符、HTML 标记。

在模型选择下一个 token 的采样阶段偷偷改变概率选择方式。

GPT 原本大致是:

P(xtx<t)tokenP(xtx<t)随机采样 token

Aaronson 当时设想变成:

P(xtx<t)P(xtx<t)带秘密密钥的伪随机采样

OpenAI 保存一个秘密 key,用一个 cryptographic pseudorandom function(密码学伪随机函数)稍微影响 token 的选择。正常读者看文本时基本感觉不到差异,但知道密钥的人可以分析文本里的 n-gram/token 序列统计量,判断它是否表现出异常强的特定统计信号。

普通 GPT:这里有 A/B/C 三个词都挺合适 → 随机选一个。

带水印 GPT:A/B/C 都合适,但秘密算法暗中更偏向满足某种隐藏规律的那个。

image-20260918203157529

2026高德纳十大战略技术趋势:

AI 原生开发平台、AI 超级计算平台、机密计算、多智能体系统、领域专用语言模型、物理 AI、先发式网络安全、数字溯源、AI 安全平台、地缘回迁。

image-20260918204223823

image-20260918204238676

计算安全:只需从载体信道分布中采样

image-20260918204359293

image-20260918204607097

论文代码

核心观点:不要在已经生成好的图片/语音上“改一点东西”来藏信息,而是让秘密信息直接决定生成模型的随机采样过程,同时保证这种采样的概率分布和正常生成完全一样。

image-20260918204847991

Kejiang Chen, Hang Zhou, Hanqing Zhao, Dongdong Chen, Weiming Zhang, Nenghai Yu. “Distribution-Preserving Steganography Based on Text-to-Speech Generative Models.” 发表于 IEEE Transactions on Dependable and Secure Computing (TDSC)

image-20260918204918876

Jinyang Ding, Kejiang Chen, Yaofei Wang, Na Zhao, Weiming Zhang, Nenghai Yu. “Discop: Provably Secure Steganography in Practice Based on ‘Distribution Copies’.” 发表于 IEEE Symposium on Security and Privacy(IEEE S&P)2023

方法:不去修改生成模型的 token 概率,而是复制同一个概率分布,通过“旋转概率区间”,用不同的分布副本编号来编码秘密比特。

旋转 = [0,1) 这个首尾相接的概率轴上做循环平移,如右图所示

image-20260918204937196

Xin Zhang, Kejiang Chen, Na Zhao, Weiming Zhang, Nenghai Yu, “Provably Secure Public-Key Steganography Based on Admissible Encoding,” IEEE TIFS, 2025.

传统可证安全隐写很多是:

发送方预共享秘密密钥接收方

问题是,通信前就得把密钥偷偷交给对方。

这篇想变成:

发送方只知道公钥隐写接收方用私钥恢复

也就是把传统密码学里的公钥加密引进可证安全隐写。

image-20260918204952058

Yuang Qi, Kejiang Chen, Na Zhao, Zijin Yang, Weiming Zhang, “Provably Secure Image Robust Steganography via Cross-modal Error Correction,” AAAI 2025.

可证安全图像隐写的痛点:

大多隐写在生成图像的离散 token 中。

例如:

q1,q2,q3,VQDecoderq1,q2,q3,VQ Decoder图片

但把图片重新经过 VQ Encoder:

图片q^1,q^2,q^3,

通常:q^iqi

且有可能发生压缩和失真,比如图片上传微信、微博、网页后,又经过 JPEG 压缩。

解决方法:

(1) PPT 中间的 Discrete Token Optimization

生成出 stego token 后,优化 token/对应表示,使:

qDecoderIEncoderq^

里的qq^尽可能成立。

(2)论文标题里的Cross-modal Error Correction,跨模态纠错。

它不仅发送隐写图片,还产生与图片相关的隐写文字,即正常文字里面秘密藏着纠错信息,以帮助恢复经过有损处理的图像。

image-20260918211947154

SpecStega: Provably Secure Linguistic Steganography Based on Speculative Sampling in Asymmetric Resource Scenarios ,ACM CCS 2026

解决了一个非常现实的问题:发送方很强,接收方很弱。

很多语言隐写方案假定:

发送方和接收方都有:

p(xt|x<t)

而且两边模型还得差不多。

但现实可能是:

发送方:服务器上的 70B 大模型 接收方:手机上的 1B 小模型

它借用了大模型推理中的投机采样思想。

前面的小模型负责进行Entropy-Adaptive Embedding

也就是根据信息熵决定当前 token 能承载多少秘密信息。

随后大模型负责Distribution Alignment防止为了藏秘密而让文本分布明显异常。

接收方则只需要共享的小模型,根据 token 的统计关系恢复 bit,并结合 LDPC 做纠错。

image-20260918212001338

image-20260918212008687

Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models,CVPR 2024

Stable Diffusion 从zTN(0,I)开始,随机生成一大堆标准高斯噪声,然后逐步去噪变成图片。

作者考虑让zT 里面藏 watermark,同时仍然严格像 N(0,I)

image-20260918212022162

左:CoSDA: Enhancing the Robustness of Inversion-based Generative Image Watermarking Framework,AAAI 2025

论文把误差分成两类。

① 内部误差。生成的时候可能有prompt、CFG、guidance scale,检测的时候却不知道原 prompt,或者参数不一致。

于是生成路线反演路线

CoSDA 提出 Compensation Sampling,在正向生成时就补偿这种 mismatch。

② 外部误差。图片还可能经过JPEG、blur、noise、compression。所以它又搞了Drift Alignment Network,把偏掉的 latent 拉回原来的位置。

右:SynTag: Enhancing the Geometric Robustness of Inversion-based Generative Image Watermarking,ICCV 2025。

CoSDA 擅长处理 JPEG、噪声这种问题。

可是如果图片旋转、裁剪、缩放、平移,watermark 的空间位置会全部错位。

SynTag 的思想:不要费劲寻找“怎么旋转都不变”的水印;直接增加一个会跟着几何变换一起变化的同步标记。

也就是 Synchronization Tag,SynTag

论文通过微调 VAE decoder 注入一个不可见的 SynTag;如果图片发生几何变换,这个 tag 也会产生相应变换。预测网络根据 tag 推断几何变换,再把图片/特征校正回来,之后才正常读取 watermark;还设计了 dither compensation 进一步提高校准精度。

image-20260918212033663

TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity,ICCV 2025

image-20260918212044402

T2SMark: Balancing Robustness and Diversity in Noise-as-Watermark for Diffusion Models,NeurIPS 2025

解决问题:watermark 越强,生成多样性往往越差。

(1)Tail-Truncated Sampling (TTS):它把真正携带 bit 的样本放到离判决边界更远的 tail region,提高鲁棒性,同时保留随机空间以尽量维持 diversity。

(2)引入随机的session key

image-20260918212056229

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models,ICLR 2026。

前面 Gaussian Shading、T2SMark 等 Noise-as-Watermark 方法都绕不开:

图片Diffusion inversionzT检测水印

Diffusion inversion 太慢

论文观察到,反演轨迹的曲率明显低于正向生成轨迹。于是提出Fast Asymmetric Robust Inversion,直接进行one-step inversion。

image-20260918212105835

SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks,ICML 2026

攻击者可能:

  1. 拿到一张带 watermark 的合法图片;

  2. 黑盒访问生成模型;

  3. 学会/转移这种 watermark;

  4. 把 watermark 放到另一张不属于该平台的图里。

于是发生,检测器把伪造图+真的 watermark,认为是我方的图。

SemBind 让 watermark 不再只是WM=用户 ID,而变成和图片语义绑定。

它训练一个semantic masker,通过对比学习得到 semantic binary code:相同/相似语义得到接近的 code,不同语义的 code 尽量可分。然后把这个 code 变换成 mask,去调制 latent watermark。

image-20260918212126858

Detecting Voice Cloning Attacks via Timbre Watermarking,NDSS 2024

image-20260918212138060

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

提出了Robust Diffusion Distance(RDD),衡量watermark 能随着 I2V 生成过程“传多远、活多久”。然后提出video-simulation noise layer模拟图片变视频以后可能经历的时序变化/失真。

image-20260918212148377

image-20260918212159527

image-20260918212212412

面向感知系统的多模态大模型安全:评估方法和验证平台

image-20260918213243709

image-20260918213302039

image-20260918213311105

image-20260918213354061

image-20260918213402538

image-20260918213417494

论文:TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models, NAACL 2025 Demonstration Track

image-20260918213426483

image-20260918213849972

image-20260918213904479

image-20260918213916311

文生图生态中的插件投毒

围绕着《Customization under Fire: Plugin Poisoning in Text-to-Image Ecosystem Jiahao Chen, Xing He, Yong Yang, Xinfeng Li, Chunyi Zhou, Junhao Li, Zhe Ma, Tianyu Du, Shouling Ji ACM CCS 2026,arXiv:2606.09151》

image-20260918214011533

image-20260918225813659

image-20260918225821082

image-20260918225828488

image-20260918225834975

image-20260918225848219

image-20260918225856192

image-20260918225905250

image-20260918230106782

image-20260918230117750

image-20260918231158756

minΔθbmaxΔθbBβ3(Δθb)[Latk(θb+αΔθb,Da)+λLpre(θb+αΔθb,Db)].

image-20260918231210775

image-20260918231227001

image-20260918231249596

image-20260918231304284

image-20260918231315536

image-20260918232017116

image-20260918232025096

image-20260918232033820

image-20260918232045128

image-20260918232054608

image-20260918232105942

生成式多媒体模型安全认知构建与知识重塑

image-20260918232126784

image-20260918232711033

image-20260918232725849

image-20260918232733964

image-20260918232742309

image-20260918232749737

image-20260918232759761

image-20260918232809940

image-20260918232820591

image-20260918232830652

image-20260918232841554

image-20260918232856778

image-20260918232910654

Orthogonal Concept Erasure for Diffusion Models Yuhao Sun, Lingyun Yu, Haoxiang Xu, Fengyuan Miao, Zhuoer Xu, Hongtao Xie, ICML 2026 Oral

WW+ΔW改为W=PW,其中PP=I

image-20260918232920025

image-20260918232929073

INPO: Image-based Negative Preference Optimization for Concept Erasure in Text-to-Image Diffusion Models

INPO 借鉴 NPO,把目标概念定义为一个negative preference,当前模型和冻结的原始模型做比较。

用噪声预测误差近似 log likelihood:

Sθ(x;c)=Et[w(t)ϵϵθ(xt,t,c)2]

然后关注:

ΔS=SθSref

这样就有一个相对基准,而不是无止境地把梯度往外推。

PPT 右边 A:Concept Mask MM

所以 INPO 得到一个MM只对目标区域算 loss:

Sθ(x;c,M)=Et[w(t)M(ϵϵθ)2]

论文明确将 Concept Mask 用于避免目标概念之外区域受到连带破坏。

PPT 右边 B:ANS,自适应负缩放

根据当前擦除程度 ΔS,定义:

α(ΔS)=σ[γ(ΔSτ)]

当擦除还不够:α1→ 大力更新。

当擦除已经够了:α0→ 自动减小更新。

PPT 右边 C:Prior Preservation Loss

要求擦除后的模型对这些内容和原模型保持一致:

Lprior=E[ϵθϵref2]

image-20260918232938147

SDErasure: Concept-Specific Trajectory Shifting for Concept Erasure via Adaptive Diffusion Classifier

Fengyuan Miao, Shancheng Fang, Lingyun Yu, Yadong Qu, Yuhao Sun, Xiaorui Wang, Hongtao Xie ICLR 2026

SDErasure 发现,扩散模型中一个具体概念真正形成,只依赖少数关键 timestep。

没必要修改所有轨迹,不然就是PPT中的“全时步统一擦除易损伤共享结构”。

论文利用一个 Diffusion Classifier判断论文利用一个 Diffusion Classifier。

Quality Regulation:

除了选对 timestep ,SDErasure 又加了两道“护栏”。

Early-preserve loss: 最早期的步骤负责生成图像的基本结构:

这些步骤不能乱动。

所以要求擦除模型仍和原模型保持一致:

Lp=ϵθϵθ2

相当于早期轨迹禁止乱碰。

Concept-retain loss:

对其他概念dog、car、house……同样要求:

Lr=ϵθ(cr)ϵθ(cr)2

相当于不相关的概念别动。

image-20260918232946253

image-20260918232955958

image-20260918233700593

image-20260918233708110

image-20260918233717688

image-20260918233727904

image-20260918233736547

From Evaluation to Defense: Advancing Safety in Video Large Language Models, Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie, ICLR 2026

视频里危险信息可能是跨帧逐渐出现的——单独看任何一帧可能都不是特别危险,但整段视频组合起来存在风险。

image-20260918233745674

image-20260918233810940

Meerkat-VL: Implicit Risk Safety Alignment in Multimodal LLMs via Perceptual Reasoning and Self-Verification

Peicheng Zhou, Chuanbin Liu, Shancheng Fang, Bowei Pu, Yiwei Sun, Zhangchi Hu, Hongtao Xie ICML 2026

隐式风险:

Image alone = safe

Text alone = safe

但是:

Image + Text = unsafe

image-20260919002559674

image-20260918233824168

image-20260918233834276

UpSafe°C: Upcycling for Controllable Safety in Large Language Models

image-20260919002503313

image-20260919002528957

image-20260918233848674

image-20260918233911111

image-20260918233923931

image-20260918233934441

image-20260918233945787

image-20260918233955186

生成式内容鉴别与安全

image-20260918234003827

image-20260918234010738

image-20260918234017567

image-20260918234024953

image-20260918234032869

右下角:生成对抗模型(GAN)

image-20260918234052901

image-20260918234100918

image-20260918234110303

image-20260918234117390

image-20260918234125788

image-20260918234134502

image-20260918234145518

image-20260918234151927

image-20260918234158280

image-20260918234204518

image-20260918234210699

image-20260918234219563

Masked Relation Learning for DeepFake Detection Ziming Yang, Jian Liang, Yuting Xu, Xiao-Yu Zhang, Ran He IEEE Transactions on Information Forensics and Security, 2023

image-20260918234240316

UCF: Uncovering Common Features for Generalizable Deepfake Detection, Zhiyuan Yan, Yong Zhang, Yanbo Fan, Baoyuan Wu ,ICCV 2023

UCF 发现传统 DeepFake detector 学错东西了.

假设训练集有三种伪造:

A=FaceSwap

B=DeepFakes

C=NeuralTextures

模型很容易学“FaceSwap 的边缘长这样。”,而不是“所有假脸真正共有的本质是什么。”

image-20260918234257366

image-20260919001050199

image-20260918234304959

image-20260919001104350

使用多任务逼迫模型学习method-specific information

image-20260918234326416

image-20260918234332461

Trustworthy Forgery Detection with Causal Inference Junxian Duan, Fan Ji, Yi Li, Hao Sun, Ran He 发表于 Science China Information Sciences

普通 DeepFake 检测器学的是:XY

但模型很可能学到的是相关性,而不是稳定的“伪造原因”。

比如训练集里的假脸碰巧经常:

于是模型可能偷偷学成:

压缩严重⇒Fake

论文因此不是单纯“再设计一个更强的 CNN”,而是从因果推断角度重新解释 DeepFake detection。

PPT中K=domain knowledge

image-20260918234341328

视觉+听觉+内容

image-20260918234348595

image-20260918234354735

image-20260918234401683

image-20260918234407722

image-20260918234414402

image-20260918234420208

image-20260918234426052

MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs

Xuannan Liu, Zekun Li, Peipei Li 等,ICLR 2025

它发现真实假新闻已经不是“单一造假”,传统检测数据往往:

“给一张图片 → 判断真/假。”

或者:

”给一句新闻 → 判断真/假。“

真实网络内容则可能是:(如左侧PPT)

真图片+假文字

或者:

AI 图片+真文字

或者:

两个东西都是真的,但是,它们根本不属于同一件事。

MMFakeBench 把伪造来源划成三大类

Textual Veracity Distortion文字事实被篡改。

Visual Veracity Distortion图像本身被AI生成或修改。

Cross-modal Consistency Distortion图和文字各自可能都是真的,但配错了。

进一步细分成 12 个 misinformation sub-types

image-20260918234431870

image-20260918234437652

MD-Agent 把任务拆成Textual Veracity Check。

先问:文字说的事情真实吗?

然后:Visual Veracity Check,问“图片是正常真实图片,还是 AI/编辑图片?”

最后Cross-modal Consistency,问“图片和文字是在说同一件事情吗?”

每一个子任务又不只生成一个理由,而是做multi-perspective rationales

比如:

最后综合多个角度的 evidence。

image-20260918234444605

T²Agent: A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search

Xing Cui, Yueying Zou, Zekun Li, Peipei Li, Xinyuan Xu, Xuannan Liu, Huaibo Huang AAAI 2026

image-20260918234450595

信息隐藏的些许思考

image-20260920012742816

哲学+本体论+认知论

image-20260920012804357

01隐写术

image-20260920013357125

image-20260920013417338

01通信主体

image-20260920013450616

存在性保护 + 行为保护 → 隐蔽性

“关系保护” → 匿名性

image-20260920013507972

image-20260920013633402

image-20260920013746795

image-20260920013808327

image-20260920013822233

image-20260920013836512

image-20260920013851484

image-20260920014036931

image-20260920014053735

image-20260920014130541

image-20260920014144119

image-20260920014349034

image-20260920014442884

特征观测映射 ϕ, 采用 SRM 类高维统计特征提取

image-20260920014508230

image-20260920014526293

1983年提出理论概念,历经10余年沉淀,直到90年代数字图像LSB隐藏的工程实践完成了从理论构想到工程实现的转变。

image-20260920014724493

image-20260920014736183

反智能技术初探

image-20260920015141180

image-20260920015156394

image-20260920015208414

image-20260920015218919

image-20260920015233313

image-20260920015721966

Less is More: Fewer Interpretable Region via Submodular Subset SelectionICLR 2024 Oral

先把图片切成若干区域:用 superpixel 或 SAM,把图片变成 N 个有语义的小块。

不逐像素算重要性,而是选“最有贡献的一组区域”。构造一个子模函数 F(S),综合考虑:

来评价区域集合 SS 对模型预测有多重要。

双向贪心搜索:一边不断挑“最重要”的区域加入集合,另一边同时找“最不重要”的区域,

生成 attribution map:排在前面的区域就是模型做出判断最依赖的区域,即左边的红色/蓝色归因热图。

image-20260920015706614

image-20260920015737130

image-20260920015753771

image-20260920015820127

Visual Commonsense R-CNN,CVPR 2020

image-20260920015832934

Multiple Adverse Weather Conditions Adaptation for Object Detection via Causal Intervention,IEEE TPAMI 2024

image-20260920023240653

image-20260920015900836

image-20260920015912470

image-20260920020307782

image-20260920020355726

image-20260920020530346

在少量查询时分别对三个任务直接攻击很困难

黑盒场景下,不同任务如果分别进行攻击,会需要大量查询;而 CEMA 想利用不同任务之间的攻击迁移性,把多任务攻击转化为较容易处理的分类攻击。

image-20260920020616339

image-20260920020634210

image-20260920020647465

image-20260920020957653

image-20260920021011860

image-20260920021026754

image-20260920021135690

image-20260920021209849

image-20260920021323202

对抗机器学习(AML, Adversarial Machine Learning)的典型要求:

image-20260920021341973

image-20260920021414347

image-20260920021430134

image-20260920021450994

image-20260920094253702

image-20260920021509181

image-20260920021522323

image-20260920021534155

高泛化性和可解释性的AIGC检测技术

image-20260920021548729

视觉语义异常检测

image-20260920021617009

image-20260920022916618

image-20260920022925712

image-20260920022935590

image-20260920023009299

image-20260920023527089

image-20260920023540931

image-20260920091426815

image-20260920091438019

image-20260920091548429

image-20260920091604828

image-20260920091717861

image-20260920091732765

image-20260920091752131

image-20260920091806978

image-20260920091837938

论文PPT

image-20260920092114743

image-20260920091851969

Rethinking the Up-Sampling Operations in CNN-based Generative Network for Generalizable Deepfake Detection Chuangchuang Tan, Yao Zhao, Shikui Wei, Guanghua Gu, Ping Liu, Yunchao Wei, CVPR 2024

image-20260920091915967

image-20260920095139437

image-20260920091925647

image-20260920091937937

image-20260920091947931

image-20260920092152195

image-20260920092201609

image-20260920092211476

image-20260920092229074

image-20260920092245744

从数据到模型再到智能体:智能装备安全面临新挑战

image-20260920023616072

image-20260920023625162

image-20260920023633507

智能体网络安全探索与思考

image-20260920023644745

image-20260920023726761

image-20260920023737519

image-20260920023752989

image-20260920023801458

image-20260920023811416

image-20260920082349154

image-20260920082401890

image-20260920082411503

image-20260920082420852

image-20260920083144308

image-20260920083157022

image-20260920083207810

image-20260920083218672

image-20260920083238517

image-20260920083249066

image-20260920084927231

image-20260920084944618

image-20260920084958046

image-20260920085010665

image-20260920085021791

image-20260920085040395

image-20260920085056044

image-20260920085113633

image-20260920085126561

image-20260920085141639

image-20260920085155445

image-20260920085210064

image-20260920085218899

image-20260920085228716

智能汽车安全能力框架

image-20260920090813629image-20260920090821781

image-20260920090832114

image-20260920090841215image-20260920090849856

image-20260920090901751

image-20260920090926966

认知安全中策略智能生成技术及应用

image-20260920191916399

image-20260920191926606image-20260920191926770

image-20260920191939400

image-20260920191949639

image-20260920192003488

认知失调理论——心理学家 Leon Festinger 在 1957 年系统提出的理论

房屋模型”——北约认知战 House Model—— NATO STO 的 HFM-ET-356 团队提出。

image-20260920192546683

image-20260920192608237

image-20260920192630275

左下角被挡住的:博弈优化

image-20260920192652337

image-20260920192700644

image-20260920192718524

image-20260920192726344

image-20260920192738372

中间被挡住的字:垂域小模型

image-20260920192803939

image-20260920192810440

image-20260920192820059

image-20260920192830314

image-20260920192843298

高通量视频内容理解与安全

image-20260920192857626

image-20260920192908462

image-20260920193118312

image-20260920193131667

image-20260920193146693

image-20260920193156690

Long-Short Term Cross-Transformer in Compressed Domain for Few-Shot Video Classification,IJCAI 2022

image-20260920201923630

image-20260920193206255

image-20260920193217190

image-20260920193228405

Task-Aware Attentional Dynamic Alignment for Few-Shot Compressed Video Classification,IEEE TCSVT 2025

image-20260920202917417

image-20260920193234478

image-20260920193241808

image-20260920193251267

image-20260920193300175

Practical Face Swapping Detection Based on Identity Spatial Constraints,IJCB 2021

除了给一张可疑人脸,还给一张同一个人的真实参考照片。

参考照片经过身份特征网络,得到这个人的 identity information;待检测照片经过主干网络提取多尺度视觉特征。

随后比较两者在身份相关区域上的对应关系,构造 Identity Spatial Constraint,身份空间约束,让检测网络重点检查真正和“这个人是谁”有关的部位,而不是背景、头发等容易过拟合的数据特征。

image-20260920193307850

AUNet: Learning Relations Between Action Units for Face Forgery Detection,CVPR 2023

DeepFake 不一定每一个局部都有明显瑕疵,但不同面部区域之间的关系可能不自然。

image-20260920205629674

image-20260920193325470

image-20260920193334124

image-20260920193341684

Deepfake Detection via Exploring Degradation Inconsistency,IEEE TIFS 2026

真实数字照片经历:

相机成像→缩放→压缩→传输→再压缩→⋯相机成像。这些过程都会留下退化。

如果一张图是换脸得到的,那么背景和原始头部可能来自 A 的图像处理链, 后来贴进去的伪造脸区域可能经历了 B 的生成/退化过程。虽然内容看起来连得上,退化“指纹”却不一致。

image-20260920193348272

image-20260920193355564

image-20260920193405354

Learning to Explore Distillability and Sparsability: A Joint Framework for Model Compression,IEEE TPAMI 2023

image-20260920205733011

设计了 teacher、student 和 dean 三种角色。作者提出两个概念:

Distillability——表示模型现在“还有多少知识值得从 teacher 学”;

以及Sparsability——表示模型当前“还能安全地裁掉多少”。

由此设计 DDSL。Teacher 教 Student,而 Dean 动态观察训练状态,自动调整“这一阶段应该多蒸馏一点还是多剪一点”。

image-20260920193411846

Cross-Architecture Knowledge Distillation,ACCV 2022/ IJCV 2024

CNN 在服务器和边缘设备上都具有良好的硬件友好性。因此,将高性能 Transformer 的知识蒸馏到紧凑的 CNN 中是一个自然的想法。然而,两者之间存在较大的架构差异。

作者加入“翻译器”。PCA(Partially Cross-Attention Projector)把 CNN 学生特征映射到 Transformer 的 attention 空间,让学生学习 teacher 的全局注意关系。GL(Group-wise Linear Projector)再把 CNN 特征映射到与 Transformer token 特征更匹配的空间。

IJCV扩展版引入引入 Adaptive Distillation Router (ADR),自动决定Teacher 的哪一层,应该去教 Student 的哪一层。

image-20260920193422711

image-20260920193432154

image-20260920193440128

Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models2026 年 9 月 15 日arXiv,2609.16589

image-20260920205521141

第一部分(PPT 左上):LLM 有没有价值倾向?

作者不是直接问:“你是什么价值观?”

而是借用社会科学中的价值观测量体系,把模型放进类似人类社会调查的坐标系。他们测试了 106 个 LLM,每个模型约 15 万次查询,同时使用约 9.5 万份人类调查 profile 作为对照。作者报告的结果是,模型回答在该测量空间里并没有像人类一样高度分散,而是形成较集中的所谓“crystallized value core”。

第二部分(PPT 左中下):PEC 怎么量化?

这是照片左下最关键的公式:V=C(P,E)

大意是把模型表现出来的 value expression 拆成三个来源:

(1)P = Prior,模型自身已有的倾向,比如训练形成的参数、内部先验。

(2)E = Environment,外部环境,比如 system prompt、user prompt、上下文。

(3)C = Cognition,推理过程,例如 Chain-of-Thought 对最终价值表达产生的影响。

所以它试图解决一个很有意思的问题:

同一个模型某个问题回答变了,到底是因为:

模型本身就有这种倾向?还是换了提示词把它推过去了?还是推理过程使最后答案发生偏移?

第三部分:如何 Alignment?

作者进一步根据 PEC 的诊断结果决定用多强的干预,从很便宜的Prompt intervention逐渐到较重的Parameter update寻找作者所谓的 minimum effective intervention。

image-20260920193452020

3.Cross-Architecture Knowledge Distillation,International Journal of Computer Vision (IJCV), 2024, 132(8): 2798–2824。

4.FiGVCL: Fine-Grained Benchmark and Method for Video Copy Localization, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025

社会智能驱动的认知安全

image-20260920200340645

image-20260920200347149

image-20260920200357660

image-20260920200406021

右下角被挡住的:用户

image-20260920200421776

image-20260920200429172

image-20260920200437156

image-20260920200446177

image-20260920200453559

image-20260920200521491

image-20260920200527727

image-20260920200543021

image-20260920200554211

image-20260920200601571

image-20260920200625680

image-20260920200633611

image-20260920200643097

image-20260920200651494

image-20260920200659243

image-20260920200707178

image-20260920200713803

image-20260920200720154

image-20260920200727377

image-20260920200734484

image-20260920200749538

image-20260920200757204

image-20260920200805526

image-20260920200811539

image-20260920200818371

image-20260920200824521

image-20260920200831040

image-20260920200837429

image-20260920200845437

image-20260920200853291

image-20260920200900859

image-20260920200938655

image-20260920201407065

image-20260920201414755

基于大模型的虚假信息检测

image-20260920201431561

image-20260920201451458

image-20260920201542806

image-20260920201556788

image-20260920201604500

image-20260920201612409

image-20260920201619068

Multi-Task SE-Network for Image Splicing Localization, IEEE TCSVT 2022

image-20260920212818871

image-20260920205823201

image-20260920205835003

和谐化的定义

普通拼接:从 A 图剪个人 → 粘到 B 图。

很容易出现颜色、亮度、色调、光照不协调。

而和谐化会继续用 AI 把粘贴区域的色调、亮度、光照、风格调整得和背景一致。于是之前方法依赖的“接缝痕迹”很多被洗掉了。

image-20260920205842402

image-20260920213059267

image-20260920205848318

image-20260920205853951

image-20260920205900562

(疑似最新的未发表的论文)

image-20260920205906577

image-20260920205912470

image-20260920205918827

image-20260920205925116

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models,NeurIPS 2025

image-20260920213453891

MLLM,比如 GPT-4o,虽然很聪明,但经常依赖高层语义。

但真正的 AI 生成痕迹可能存在于:边缘、纹理、局部亮度、高频结构、很微弱的视觉统计差异等。

于是论文专门设计了一个Low-Level Vision Comparison Pipeline比较真实图和生成图中的低层视觉差异,然后把这些取证信息转化成MLLM 容易理解的描述。

同时它提出EkCot,即一种外部知识引导的描述/推理方式。利用 image generation pipeline 的外部知识,引导 MLLM 按照DetectionLocalizationAttribution

进行结构化分析。

image-20260920205933854

image-20260920205941500

image-20260920205947004

image-20260920205953859

image-20260920205959491

ArtGate: Injecting Fake Artifact Features into CLIP for AI-Generated Image Detection, IEEE Transactions on Multimedia,2026

image-20260920222512276

image-20260920210005391

image-20260920210011598

image-20260920210016939

image-20260920210022678

image-20260920210030786

image-20260920210038119

Domain-Invariant Representation Learning for Generalizable Deepfake Speech Detection, IEEE Transactions on Circuits and Systems for Video Technology,2026

image-20260920210044320

image-20260920210050859

image-20260920210057258

(疑似最新的未发表的论文)

image-20260920210104661

(疑似最新的未发表的论文)

image-20260920210110787

image-20260920210117327

目前,可解释性和精度是冲突的。

生成式文本检测溯源技术及应用

image-20260920235135890

image-20260920235144562

image-20260920235157958

image-20260920235625020

image-20260920235633116

image-20260920235642597

2023年chatgpt出来才有这项技术。

image-20260920235907836

image-20260920235918985

image-20260921000137377

Google 著名的 SynthID-Text 论文(“Scalable watermarking for identifying large language model outputs”),claude也是采用这种思想。

image-20260921000900367

image-20260921000153625

image-20260921000202491

image-20260921000212644

Subtle Signatures, Strong Shields: Advancing Robust and Imperceptible Watermarking in Large Language Models,Findings of ACL 2024

image-20260921000449348

image-20260921000457974

image-20260921000509757

image-20260921000522108

image-20260921000533372

Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework, Findings of ACL 2026

image-20260921001822181

image-20260921000545407

image-20260921000555403

右下角:AIGC 文本检测器的检测性能越差

image-20260921001226040

image-20260921001233014

Reliably Bounding False Positives: A Zero-Shot Machine-Generated Text Detection Framework via Multiscaled Conformal Prediction,ACL 2025

image-20260921003113209

image-20260921001245320

image-20260921001300490

DNA-DetectLLM: Unveiling AI-Generated Text via a DNA-Inspired Mutation-Repair Paradigm,NeurIPS 2025

image-20260921003208613

image-20260921003222858

image-20260921001308479

image-20260921001316177

Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection,ACL 2026

强相关token的判别信息被无关token淹没

提出基于外显子/内含子的功能区分机制,放大关键 token 的判别信息

image-20260921003444700

image-20260921001327112

image-20260921001333780

image-20260921001342134

image-20260921001354450

image-20260921001403189

image-20260921001412013

AIGC下Deepfake技术在新型科技犯罪场景的应用和治理应对

image-20260920210431276

image-20260920210439783

image-20260920210451079

image-20260920210456871

image-20260920210504396

image-20260920210510931

image-20260920210518412

image-20260920210525465

image-20260920210531739

image-20260920210539611

image-20260920210548963

image-20260920210557565

左下角:犯罪执行加速化

image-20260920210620674

image-20260920210628690

image-20260920210635635

image-20260920210642559

image-20260920210649670

image-20260920210658874

海报

93493f6387673f64c369039e20e692a1

777c8a3eb3f180e8ba2f10ac00e84e55

3786a30e17dc0a90c9cc9ba688f8abce

 

⚠️ 图片加载提示

本页包含 -- 张图片,总计约 --

点击「开始加载」后将边加载边显示,页面顶部会显示实时进度。