Privacy Risks of General-Purpose Language Models
系统测量通用语言模型中的隐私泄露风险。
原文 ↗
女娲实验室 · 研究
以研究定义风险,以证据构建安全,聚焦前沿 AI 风险、智能体安全、系统安全与网络安全。
86 项研究成果 6 个研究主题 6 项荣誉
代表成果
五项代表性工作,连接前沿风险、智能体防护与系统安全。
系统测量通用语言模型中的隐私泄露风险。
原文 ↗提出 AgentDoS,检测智能体资源滥用导致的拒绝服务漏洞。
原文 ↗
自我复制、环境适应与抗关闭测试构成可执行的前沿风险证据链
原文 ↗以仿真推理校准降低计算机操作智能体的不安全行动。

Thought-Aligner 在危险行动发生前修正推理路径,并保留任务能力
原文 ↗研究与公共影响
关注与研究方向相关的国际共识、研究议程和国家安全标准
由 Geoffrey Hinton、Yoshua Bengio、姚期智等 32 位全球专家联署,汇集图灵奖与诺贝尔奖得主
确保高级人工智能系统的对齐与人类控制,以保障人类福祉共识声明
围绕高级人工智能系统的对齐、人类控制、安全保障与可验证行为红线形成国际科学共识。
其他联署专家包括 Stuart Russell · Sam Bowman · Max Tegmark
由 100 余位全球贡献者形成,覆盖 13 个国家和 4 类研究优先级
2026 AI 安全新加坡全球研究优先级共识
汇聚前沿模型开发机构、政府安全研究机构、学术界与社会组织,共同定义紧迫的 AI 安全研究问题。
研究基础设施
以公开评测环境与基准,让智能体网络安全能力得到持续观测与验证。
研究版图
荣誉与认可
出版物
86 项成果
合成结合确定性代码状态与叙事动态的可执行风险环境。
提出 AgentDoS,检测智能体资源滥用导致的拒绝服务漏洞。
研究智能体与基础模型的安全风险及防护方法。
揭示应用内应用云服务中的不安全资源管理问题。
推进软件与智能系统的漏洞发现、测试和防护。
检测固件 Web 服务跨 C 与 Lua 边界的污点型漏洞。
通过近似潜变量解码,在扩散生成过程中低成本检测不安全内容。
以 KVM 近原生执行重托管 MCU 固件,支持规模化安全分析。
以仿真推理校准降低计算机操作智能体的不安全行动。
揭示邮件别名生态中的身份混淆机制及其安全影响。
验证智能体在受控环境中获取算力并跨设备扩散的能力。
评测开放人机对话中的欺骗风险与用户信任变化。
推进软件与智能系统的漏洞发现、测试和防护。
将面向开发者的欺骗定义为独立风险,并提出可监测控制建议。
从虚假陈述、操纵与道德脱离等维度评测大模型犯罪潜力。
推进软件与智能系统的漏洞发现、测试和防护。
提出面向黑盒表格智能体的结构约束进化提示注入攻击。
提出 Thought-Aligner,在行动前因果校准不安全推理。
测量大模型增强搜索系统抵御黑帽 SEO 操纵的能力。
系统刻画小游戏生态中的激进广告行为及用户风险。
推进软件与智能系统的漏洞发现、测试和防护。
推进软件与智能系统的漏洞发现、测试和防护。
推进软件与智能系统的漏洞发现、测试和防护。
推进软件与智能系统的漏洞发现、测试和防护。
以功能变化识别远程软件版本,减少对漏洞探测的依赖。
推进软件与智能系统的漏洞发现、测试和防护。
揭示隐形 HTML 同时欺骗用户与垃圾邮件检测器的机制。
研究模型识别评测环境并改变行为所产生的观察者效应。
评测前沿 AI 系统的自主复制能力,并报告受控实验中的成功案例。
利用服务感知反馈提升 Linux 固件漏洞发现能力。
评测 32 个 AI 系统的复制、外传、适应与抗关闭行为。
提出 AgentFuzz,自动发现真实智能体应用中的污点型漏洞。
研究搜索引擎中的无意义关键词定向诈骗及治理方法。
研究智能体与基础模型的安全风险及防护方法。
测量智能体应用的漏洞安全债务与防护策略权衡。
研究智能体与基础模型的安全风险及防护方法。
测量真实网络中无服务器云函数的恶意与滥用行为。
以局部路径持久模糊测试发现跨站脚本漏洞。
评测越狱防御的安全收益及其对模型效用的持续影响。
推进软件与智能系统的漏洞发现、测试和防护。
研究隐私、滥用生态与真实世界网络安全威胁。
研究隐私、滥用生态与真实世界网络安全威胁。
研究隐私、滥用生态与真实世界网络安全威胁。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
研究隐私、滥用生态与真实世界网络安全威胁。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究隐私、滥用生态与真实世界网络安全威胁。
推进软件与智能系统的漏洞发现、测试和防护。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
推进软件与智能系统的漏洞发现、测试和防护。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
推进软件与智能系统的漏洞发现、测试和防护。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
推进软件与智能系统的漏洞发现、测试和防护。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究隐私、滥用生态与真实世界网络安全威胁。
研究隐私、滥用生态与真实世界网络安全威胁。
研究隐私、滥用生态与真实世界网络安全威胁。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
研究隐私、滥用生态与真实世界网络安全威胁。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
推进软件与智能系统的漏洞发现、测试和防护。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
直接判定 Java 可执行程序是否完整包含安全补丁。
推进软件与智能系统的漏洞发现、测试和防护。
研究机器学习模型的鲁棒性、后门、水印、投毒与可信问题。
研究智能体与基础模型的安全风险及防护方法。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
系统测量通用语言模型中的隐私泄露风险。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
推进软件与智能系统的漏洞发现、测试和防护。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。
研究隐私、滥用生态与真实世界网络安全威胁。
推进软件与智能系统的漏洞发现、测试和防护。
研究推荐、视觉与时间序列等方向的学习方法和 AI 系统。