安全评测模型
用于评估其他 AI 系统安全属性的模型与工具——推理完整性、意图与行为风险。
服务范围
白泽的模型服务将女娲实验室在前沿 AI 风险方面的研究转化为模型能力,用于评测其他 AI 系统的安全性,并在智能体系统中增强运行时安全。
用于评估其他 AI 系统安全属性的模型与工具——推理完整性、意图与行为风险。
在智能体系统中提供思维校准、意图检查与运行时防护的轻量模型。
模型来源
白泽的模型服务清晰区分模型来源,帮助用户了解模型是自研、微调还是托管。
由白泽和女娲实验室基于前沿 AI 风险与安全研究构建的模型。
使用白泽的安全数据和方法适配的开放或合作伙伴模型。基座模型与微调方法将明确记录。
通过白泽基础设施提供的第三方模型,明确标注原始提供方。
接入方式
加入心愿单并说明使用场景、模型或智能体环境、部署阶段与期望时间。我们会根据这些信息评估合适的产品路径,同时不发布未经验证的价格、性能或可用性信息。
加入心愿单获取更新
研究更新和模型服务更新是不同的内容,请根据你的兴趣分别订阅。
在 Substack 上订阅女娲实验室的研究通讯。
在 Substack 订阅 ↗说明使用场景与部署计划,加入模型服务产品访问心愿单。
加入心愿单文档与资源
你可以在 GitHub 与 Hugging Face 上探索白泽的开源项目,包括评测工具和安全模型。