讲者:中国科技技术大学教授,华东南京学院院长,中国网络工程师学会常务理事,中国中央经济学会常务理事,入选国家高层次人才计划。





ChatGPT 输出里偷偷塞零宽字符、特殊 Unicode 字符、HTML 标记。
在模型选择下一个 token 的采样阶段偷偷改变概率选择方式。
GPT 原本大致是:
Aaronson 当时设想变成:
OpenAI 保存一个秘密 key,用一个 cryptographic pseudorandom function(密码学伪随机函数)稍微影响 token 的选择。正常读者看文本时基本感觉不到差异,但知道密钥的人可以分析文本里的 n-gram/token 序列统计量,判断它是否表现出异常强的特定统计信号。
普通 GPT:这里有 A/B/C 三个词都挺合适 → 随机选一个。
带水印 GPT:A/B/C 都合适,但秘密算法暗中更偏向满足某种隐藏规律的那个。

2026高德纳十大战略技术趋势:
AI 原生开发平台、AI 超级计算平台、机密计算、多智能体系统、领域专用语言模型、物理 AI、先发式网络安全、数字溯源、AI 安全平台、地缘回迁。


计算安全:只需从载体信道分布中采样


核心观点:不要在已经生成好的图片/语音上“改一点东西”来藏信息,而是让秘密信息直接决定生成模型的随机采样过程,同时保证这种采样的概率分布和正常生成完全一样。

Kejiang Chen, Hang Zhou, Hanqing Zhao, Dongdong Chen, Weiming Zhang, Nenghai Yu. “Distribution-Preserving Steganography Based on Text-to-Speech Generative Models.” 发表于 IEEE Transactions on Dependable and Secure Computing (TDSC)

Jinyang Ding, Kejiang Chen, Yaofei Wang, Na Zhao, Weiming Zhang, Nenghai Yu. “Discop: Provably Secure Steganography in Practice Based on ‘Distribution Copies’.” 发表于 IEEE Symposium on Security and Privacy(IEEE S&P)2023
方法:不去修改生成模型的 token 概率,而是复制同一个概率分布,通过“旋转概率区间”,用不同的分布副本编号来编码秘密比特。
旋转 = [0,1) 这个首尾相接的概率轴上做循环平移,如右图所示

Xin Zhang, Kejiang Chen, Na Zhao, Weiming Zhang, Nenghai Yu, “Provably Secure Public-Key Steganography Based on Admissible Encoding,” IEEE TIFS, 2025.
传统可证安全隐写很多是:
问题是,通信前就得把密钥偷偷交给对方。
这篇想变成:
也就是把传统密码学里的公钥加密引进可证安全隐写。

Yuang Qi, Kejiang Chen, Na Zhao, Zijin Yang, Weiming Zhang, “Provably Secure Image Robust Steganography via Cross-modal Error Correction,” AAAI 2025.
可证安全图像隐写的痛点:
大多隐写在生成图像的离散 token 中。
例如:
但把图片重新经过 VQ Encoder:
通常:
且有可能发生压缩和失真,比如图片上传微信、微博、网页后,又经过 JPEG 压缩。
解决方法:
(1) PPT 中间的 Discrete Token Optimization。
生成出 stego token 后,优化 token/对应表示,使:
里的
(2)论文标题里的Cross-modal Error Correction,跨模态纠错。
它不仅发送隐写图片,还产生与图片相关的隐写文字,即正常文字里面秘密藏着纠错信息,以帮助恢复经过有损处理的图像。

SpecStega: Provably Secure Linguistic Steganography Based on Speculative Sampling in Asymmetric Resource Scenarios ,ACM CCS 2026
解决了一个非常现实的问题:发送方很强,接收方很弱。
很多语言隐写方案假定:
发送方和接收方都有:
而且两边模型还得差不多。
但现实可能是:
发送方:服务器上的 70B 大模型 接收方:手机上的 1B 小模型
它借用了大模型推理中的投机采样思想。
前面的小模型负责进行Entropy-Adaptive Embedding
也就是根据信息熵决定当前 token 能承载多少秘密信息。
随后大模型负责Distribution Alignment防止为了藏秘密而让文本分布明显异常。
接收方则只需要共享的小模型,根据 token 的统计关系恢复 bit,并结合 LDPC 做纠错。


Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models,CVPR 2024。
Stable Diffusion 从
作者考虑让

左:CoSDA: Enhancing the Robustness of Inversion-based Generative Image Watermarking Framework,AAAI 2025
论文把误差分成两类。
① 内部误差。生成的时候可能有prompt、CFG、guidance scale,检测的时候却不知道原 prompt,或者参数不一致。
于是
CoSDA 提出 Compensation Sampling,在正向生成时就补偿这种 mismatch。
② 外部误差。图片还可能经过JPEG、blur、noise、compression。所以它又搞了Drift Alignment Network,把偏掉的 latent 拉回原来的位置。
右:SynTag: Enhancing the Geometric Robustness of Inversion-based Generative Image Watermarking,ICCV 2025。
CoSDA 擅长处理 JPEG、噪声这种问题。
可是如果图片旋转、裁剪、缩放、平移,watermark 的空间位置会全部错位。
SynTag 的思想:不要费劲寻找“怎么旋转都不变”的水印;直接增加一个会跟着几何变换一起变化的同步标记。
也就是 Synchronization Tag,SynTag。
论文通过微调 VAE decoder 注入一个不可见的 SynTag;如果图片发生几何变换,这个 tag 也会产生相应变换。预测网络根据 tag 推断几何变换,再把图片/特征校正回来,之后才正常读取 watermark;还设计了 dither compensation 进一步提高校准精度。

TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity,ICCV 2025

T2SMark: Balancing Robustness and Diversity in Noise-as-Watermark for Diffusion Models,NeurIPS 2025
解决问题:watermark 越强,生成多样性往往越差。
(1)Tail-Truncated Sampling (TTS):它把真正携带 bit 的样本放到离判决边界更远的 tail region,提高鲁棒性,同时保留随机空间以尽量维持 diversity。
(2)引入随机的session key。

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models,ICLR 2026。
前面 Gaussian Shading、T2SMark 等 Noise-as-Watermark 方法都绕不开:
但Diffusion inversion 太慢。
论文观察到,反演轨迹的曲率明显低于正向生成轨迹。于是提出Fast Asymmetric Robust Inversion,直接进行one-step inversion。

SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks,ICML 2026
攻击者可能:
拿到一张带 watermark 的合法图片;
黑盒访问生成模型;
学会/转移这种 watermark;
把 watermark 放到另一张不属于该平台的图里。
于是发生,检测器把伪造图+真的 watermark,认为是我方的图。
SemBind 让 watermark 不再只是WM=用户 ID,而变成和图片语义绑定。
它训练一个semantic masker,通过对比学习得到 semantic binary code:相同/相似语义得到接近的 code,不同语义的 code 尽量可分。然后把这个 code 变换成 mask,去调制 latent watermark。

Detecting Voice Cloning Attacks via Timbre Watermarking,NDSS 2024。

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
提出了Robust Diffusion Distance(RDD),衡量watermark 能随着 I2V 生成过程“传多远、活多久”。然后提出video-simulation noise layer模拟图片变视频以后可能经历的时序变化/失真。









论文:TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models, NAACL 2025 Demonstration Track




围绕着《Customization under Fire: Plugin Poisoning in Text-to-Image Ecosystem Jiahao Chen, Xing He, Yong Yang, Xinfeng Li, Chunyi Zhou, Junhao Li, Zhe Ma, Tianyu Du, Shouling Ji ACM CCS 2026,arXiv:2606.09151》



































Orthogonal Concept Erasure for Diffusion Models Yuhao Sun, Lingyun Yu, Haoxiang Xu, Fengyuan Miao, Zhuoer Xu, Hongtao Xie, ICML 2026 Oral
将


INPO: Image-based Negative Preference Optimization for Concept Erasure in Text-to-Image Diffusion Models
INPO 借鉴 NPO,把目标概念定义为一个negative preference,当前模型和冻结的原始模型做比较。
用噪声预测误差近似 log likelihood:
然后关注:
这样就有一个相对基准,而不是无止境地把梯度往外推。
PPT 右边 A:Concept Mask MM
所以 INPO 得到一个MM只对目标区域算 loss:
论文明确将 Concept Mask 用于避免目标概念之外区域受到连带破坏。
PPT 右边 B:ANS,自适应负缩放
根据当前擦除程度 ΔS,定义:
当擦除还不够:
当擦除已经够了:
PPT 右边 C:Prior Preservation Loss
要求擦除后的模型对这些内容和原模型保持一致:

SDErasure: Concept-Specific Trajectory Shifting for Concept Erasure via Adaptive Diffusion Classifier
Fengyuan Miao, Shancheng Fang, Lingyun Yu, Yadong Qu, Yuhao Sun, Xiaorui Wang, Hongtao Xie ICLR 2026
SDErasure 发现,扩散模型中一个具体概念真正形成,只依赖少数关键 timestep。
没必要修改所有轨迹,不然就是PPT中的“全时步统一擦除易损伤共享结构”。
论文利用一个 Diffusion Classifier判断论文利用一个 Diffusion Classifier。
Quality Regulation:
除了选对 timestep ,SDErasure 又加了两道“护栏”。
Early-preserve loss: 最早期的步骤负责生成图像的基本结构:
人物还是动物?
位置在哪?
整个构图是什么?
这些步骤不能乱动。
所以要求擦除模型仍和原模型保持一致:
相当于早期轨迹禁止乱碰。
Concept-retain loss:
对其他概念dog、car、house……同样要求:
相当于不相关的概念别动。







From Evaluation to Defense: Advancing Safety in Video Large Language Models, Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie, ICLR 2026
视频里危险信息可能是跨帧逐渐出现的——单独看任何一帧可能都不是特别危险,但整段视频组合起来存在风险。


Meerkat-VL: Implicit Risk Safety Alignment in Multimodal LLMs via Perceptual Reasoning and Self-Verification
Peicheng Zhou, Chuanbin Liu, Shancheng Fang, Bowei Pu, Yiwei Sun, Zhangchi Hu, Hongtao Xie ICML 2026
隐式风险:
Image alone = safe
Text alone = safe
但是:
Image + Text = unsafe



UpSafe°C: Upcycling for Controllable Safety in Large Language Models













右下角:生成对抗模型(GAN)












Masked Relation Learning for DeepFake Detection Ziming Yang, Jian Liang, Yuting Xu, Xiao-Yu Zhang, Ran He IEEE Transactions on Information Forensics and Security, 2023

UCF: Uncovering Common Features for Generalizable Deepfake Detection, Zhiyuan Yan, Yong Zhang, Yanbo Fan, Baoyuan Wu ,ICCV 2023
UCF 发现传统 DeepFake detector 学错东西了.
假设训练集有三种伪造:
A=FaceSwap
B=DeepFakes
C=NeuralTextures
模型很容易学“FaceSwap 的边缘长这样。”,而不是“所有假脸真正共有的本质是什么。”




使用多任务逼迫模型学习method-specific information


Trustworthy Forgery Detection with Causal Inference Junxian Duan, Fan Ji, Yi Li, Hao Sun, Ran He 发表于 Science China Information Sciences
普通 DeepFake 检测器学的是:
但模型很可能学到的是相关性,而不是稳定的“伪造原因”。
比如训练集里的假脸碰巧经常:
JPEG 压缩更严重;
来自某一种生成算法;
背景分布不同;
某些人物、肤色、分辨率出现频率不同。
于是模型可能偷偷学成:
压缩严重⇒Fake
论文因此不是单纯“再设计一个更强的 CNN”,而是从因果推断角度重新解释 DeepFake detection。
PPT中

视觉+听觉+内容







MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs
Xuannan Liu, Zekun Li, Peipei Li 等,ICLR 2025
它发现真实假新闻已经不是“单一造假”,传统检测数据往往:
“给一张图片 → 判断真/假。”
或者:
”给一句新闻 → 判断真/假。“
真实网络内容则可能是:(如左侧PPT)
真图片+假文字
或者:
AI 图片+真文字
或者:
两个东西都是真的,但是,它们根本不属于同一件事。
MMFakeBench 把伪造来源划成三大类:
Textual Veracity Distortion文字事实被篡改。
Visual Veracity Distortion图像本身被AI生成或修改。
Cross-modal Consistency Distortion图和文字各自可能都是真的,但配错了。
进一步细分成 12 个 misinformation sub-types。


MD-Agent 把任务拆成Textual Veracity Check。
先问:文字说的事情真实吗?
然后:Visual Veracity Check,问“图片是正常真实图片,还是 AI/编辑图片?”
最后Cross-modal Consistency,问“图片和文字是在说同一件事情吗?”
每一个子任务又不只生成一个理由,而是做multi-perspective rationales
比如:
查关键实体;
做事实分析;
引入检索知识;
commonsense 判断。
最后综合多个角度的 evidence。

T²Agent: A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search
Xing Cui, Yueying Zou, Zekun Li, Peipei Li, Xinyuan Xu, Xuannan Liu, Huaibo Huang AAAI 2026


哲学+本体论+认知论

01隐写术


01通信主体

存在性保护 + 行为保护 → 隐蔽性
“关系保护” → 匿名性













特征观测映射 ϕ, 采用 SRM 类高维统计特征提取。


1983年提出理论概念,历经10余年沉淀,直到90年代数字图像LSB隐藏的工程实践完成了从理论构想到工程实现的转变。








Less is More: Fewer Interpretable Region via Submodular Subset Selection , ICLR 2024 Oral
先把图片切成若干区域:用 superpixel 或 SAM,把图片变成 N 个有语义的小块。
不逐像素算重要性,而是选“最有贡献的一组区域”。构造一个子模函数 F(S),综合考虑:
语义一致性
区域之间的协同作用
模型预测置信度
区域有效性
来评价区域集合 SS 对模型预测有多重要。
双向贪心搜索:一边不断挑“最重要”的区域加入集合,另一边同时找“最不重要”的区域,
生成 attribution map:排在前面的区域就是模型做出判断最依赖的区域,即左边的红色/蓝色归因热图。




Visual Commonsense R-CNN,CVPR 2020

Multiple Adverse Weather Conditions Adaptation for Object Detection via Causal Intervention,IEEE TPAMI 2024






在少量查询时分别对三个任务直接攻击很困难
黑盒场景下,不同任务如果分别进行攻击,会需要大量查询;而 CEMA 想利用不同任务之间的攻击迁移性,把多任务攻击转化为较容易处理的分类攻击。









对抗机器学习(AML, Adversarial Machine Learning)的典型要求:
Consistency:攻击前后,样本本身的语义/真实属性保持一致。比如一个人的性别、年龄段、种族等真实属性没有因为微小扰动而改变,人看上去还是同一个人。
Inconsistency:但是模型的判断发生了不一致。例如原来模型认为是 A,加入扰动后却预测为 B;或者不同模型对同一个攻击样本给出不一致结果。
Stealthiness:这种修改还要足够隐蔽,人眼不容易察觉。









视觉语义异常检测


















Rethinking the Up-Sampling Operations in CNN-based Generative Network for Generalizable Deepfake Detection Chuangchuang Tan, Yao Zhao, Shikui Wei, Guanghua Gu, Ping Liu, Yunchao Wei, CVPR 2024。
























































认知失调理论——心理学家 Leon Festinger 在 1957 年系统提出的理论
房屋模型”——北约认知战 House Model—— NATO STO 的 HFM-ET-356 团队提出。



左下角被挡住的:博弈优化





中间被挡住的字:垂域小模型











Long-Short Term Cross-Transformer in Compressed Domain for Few-Shot Video Classification,IJCAI 2022




Task-Aware Attentional Dynamic Alignment for Few-Shot Compressed Video Classification,IEEE TCSVT 2025





Practical Face Swapping Detection Based on Identity Spatial Constraints,IJCB 2021
除了给一张可疑人脸,还给一张同一个人的真实参考照片。
参考照片经过身份特征网络,得到这个人的 identity information;待检测照片经过主干网络提取多尺度视觉特征。
随后比较两者在身份相关区域上的对应关系,构造 Identity Spatial Constraint,身份空间约束,让检测网络重点检查真正和“这个人是谁”有关的部位,而不是背景、头发等容易过拟合的数据特征。

AUNet: Learning Relations Between Action Units for Face Forgery Detection,CVPR 2023
DeepFake 不一定每一个局部都有明显瑕疵,但不同面部区域之间的关系可能不自然。




Deepfake Detection via Exploring Degradation Inconsistency,IEEE TIFS 2026
真实数字照片经历:
相机成像→缩放→压缩→传输→再压缩→⋯相机成像。这些过程都会留下退化。
如果一张图是换脸得到的,那么背景和原始头部可能来自 A 的图像处理链, 后来贴进去的伪造脸区域可能经历了 B 的生成/退化过程。虽然内容看起来连得上,退化“指纹”却不一致。



Learning to Explore Distillability and Sparsability: A Joint Framework for Model Compression,IEEE TPAMI 2023

设计了 teacher、student 和 dean 三种角色。作者提出两个概念:
Distillability——表示模型现在“还有多少知识值得从 teacher 学”;
以及Sparsability——表示模型当前“还能安全地裁掉多少”。
由此设计 DDSL。Teacher 教 Student,而 Dean 动态观察训练状态,自动调整“这一阶段应该多蒸馏一点还是多剪一点”。

Cross-Architecture Knowledge Distillation,ACCV 2022/ IJCV 2024
CNN 在服务器和边缘设备上都具有良好的硬件友好性。因此,将高性能 Transformer 的知识蒸馏到紧凑的 CNN 中是一个自然的想法。然而,两者之间存在较大的架构差异。
作者加入“翻译器”。PCA(Partially Cross-Attention Projector)把 CNN 学生特征映射到 Transformer 的 attention 空间,让学生学习 teacher 的全局注意关系。GL(Group-wise Linear Projector)再把 CNN 特征映射到与 Transformer token 特征更匹配的空间。
IJCV扩展版引入引入 Adaptive Distillation Router (ADR),自动决定Teacher 的哪一层,应该去教 Student 的哪一层。



Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models,2026 年 9 月 15 日arXiv,2609.16589

第一部分(PPT 左上):LLM 有没有价值倾向?
作者不是直接问:“你是什么价值观?”
而是借用社会科学中的价值观测量体系,把模型放进类似人类社会调查的坐标系。他们测试了 106 个 LLM,每个模型约 15 万次查询,同时使用约 9.5 万份人类调查 profile 作为对照。作者报告的结果是,模型回答在该测量空间里并没有像人类一样高度分散,而是形成较集中的所谓“crystallized value core”。
第二部分(PPT 左中下):PEC 怎么量化?
这是照片左下最关键的公式:
大意是把模型表现出来的 value expression 拆成三个来源:
(1)P = Prior,模型自身已有的倾向,比如训练形成的参数、内部先验。
(2)E = Environment,外部环境,比如 system prompt、user prompt、上下文。
(3)C = Cognition,推理过程,例如 Chain-of-Thought 对最终价值表达产生的影响。
所以它试图解决一个很有意思的问题:
同一个模型某个问题回答变了,到底是因为:
模型本身就有这种倾向?还是换了提示词把它推过去了?还是推理过程使最后答案发生偏移?
第三部分:如何 Alignment?
作者进一步根据 PEC 的诊断结果决定用多强的干预,从很便宜的

3.Cross-Architecture Knowledge Distillation,International Journal of Computer Vision (IJCV), 2024, 132(8): 2798–2824。
4.FiGVCL: Fine-Grained Benchmark and Method for Video Copy Localization, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025




右下角被挡住的:用户









































Multi-Task SE-Network for Image Splicing Localization, IEEE TCSVT 2022



和谐化的定义。
普通拼接:从 A 图剪个人 → 粘到 B 图。
很容易出现颜色、亮度、色调、光照不协调。
而和谐化会继续用 AI 把粘贴区域的色调、亮度、光照、风格调整得和背景一致。于是之前方法依赖的“接缝痕迹”很多被洗掉了。





(疑似最新的未发表的论文)




VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models,NeurIPS 2025

MLLM,比如 GPT-4o,虽然很聪明,但经常依赖高层语义。
但真正的 AI 生成痕迹可能存在于:边缘、纹理、局部亮度、高频结构、很微弱的视觉统计差异等。
于是论文专门设计了一个Low-Level Vision Comparison Pipeline比较真实图和生成图中的低层视觉差异,然后把这些取证信息转化成MLLM 容易理解的描述。
同时它提出EkCot,即一种外部知识引导的描述/推理方式。利用 image generation pipeline 的外部知识,引导 MLLM 按照
进行结构化分析。





ArtGate: Injecting Fake Artifact Features into CLIP for AI-Generated Image Detection, IEEE Transactions on Multimedia,2026







Domain-Invariant Representation Learning for Generalizable Deepfake Speech Detection, IEEE Transactions on Circuits and Systems for Video Technology,2026



(疑似最新的未发表的论文)

(疑似最新的未发表的论文)


目前,可解释性和精度是冲突的。






2023年chatgpt出来才有这项技术。



Google 著名的 SynthID-Text 论文(“Scalable watermarking for identifying large language model outputs”),claude也是采用这种思想。




Subtle Signatures, Strong Shields: Advancing Robust and Imperceptible Watermarking in Large Language Models,Findings of ACL 2024





Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework, Findings of ACL 2026



右下角:AIGC 文本检测器的检测性能越差


Reliably Bounding False Positives: A Zero-Shot Machine-Generated Text Detection Framework via Multiscaled Conformal Prediction,ACL 2025



DNA-DetectLLM: Unveiling AI-Generated Text via a DNA-Inspired Mutation-Repair Paradigm,NeurIPS 2025




Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection,ACL 2026
强相关token的判别信息被无关token淹没
提出基于外显子/内含子的功能区分机制,放大关键 token 的判别信息



















左下角:犯罪执行加速化









本页包含 -- 张图片,总计约 --。
点击「开始加载」后将边加载边显示,页面顶部会显示实时进度。