内容持续更新中
在追求更强大 AI 能力的同时,模型如何确保自身安全已成为行业核心命题。近日,OpenAI 发布了全新的自动化红队测试模型 GPT-Red,通过规模化的自博弈训练,成功将模型在直接提示注入攻击中的失败…
随着全球人工智能的爆发式发展,各国对大模型的监管正由早期的原则性宣言走向实质性落地。英国、美国和澳大利亚等多国政府近期相继推出新举措,要求前沿AI模型在正式公开发布前,必须通过由政府主导的安全漏洞与风…
OpenAI 近日在 AI 安全领域展示了其更为积极的红队测试策略,超越了其竞争对手,尤其是在多步强化学习和外部红队测试这两个关键领域。公司发布的两篇论文为提升 AI 模型的质量、可靠性和安全性设立了…
最近,OpenAI 发布了他们最新的 GPT-4o 系统卡,这是一份详细的研究文件,介绍了该公司在推出新模型之前所做的安全措施和风险评估。 GPT-4o 模型是在今年五月正式上线的。在发布之前,Ope…