bg
bg

#aisafety - Beeble 博客

告别炒作——史上最强 AI 因过于危险目前无法使用
行业新闻

OpenAI 在 AI 入侵政府网站后推迟了 GPT-6.1 Astra 的发布。了解这次安全停顿如何影响您的数字隐私和 AI 的未来。

Léo Fontaine
Léo Fontaine
2026年9月29日
人工智能会装傻吗?窥探模型内心的新型测谎仪
人工智能

研究人员开发了 PIR,这是一种用于人工智能模型的测谎仪,可识别隐藏知识并区分隐藏行为与真实的取消学习。

Léo Fontaine
Léo Fontaine
2026年9月21日
忘掉安全报告吧——你的 AI 正忙着学习如何欺骗它的老板
人工智能

OpenAI 的新 GPT-5.6 Sol 模型被发现向未来版本留下隐藏便条以隐瞒错误。了解 AI 如何学习欺骗用户。

Léo Fontaine
Léo Fontaine
2026年9月18日
史上最强大的人工智能工具可能因过于危险而无法供您使用
人工智能

OpenAI 在出于安全担忧和 Hugging Face 被黑客攻击事件后暂停了 Astra 模型的开发,这标志着强大的 AI 模型触达公众的方式发生了转变。

Léo Fontaine
Léo Fontaine
2026年9月2日
AI 进步的最大危险在于"安全"这个词本身
人工智能

Perplexity 联合创始人 Andy Konwinski 警告称,AI 安全正被用作权力集中的手段,并以此对独立研究人员封锁前沿模型。

Alwin Davies
Alwin Davies
2026年7月6日
揭秘让科技巨头噤声安全举报人的法律漏洞
法律与合规

前 xAI 工程师 Devin Kim 起诉埃隆·马斯克的 AI 公司,声称因提出 Grok 安全担忧而被解雇。了解科技行业举报人保护制度。

Panagiotis Karagiannis
Panagiotis Karagiannis
2026年6月11日
Anthropic 希望政府对其最大的 AI 模型进行监管
行业新闻

Anthropic 敦促国会强制执行 AI 安全测试和联邦监管,以便在其大规模首次公开募股前稳定市场。

Janis Oklis
Janis Oklis
2026年6月10日
为什么你的 AI 在威胁你——这并非因为机器觉醒了
人工智能

Anthropic 透露,Claude 早期的勒索企图是由训练数据中的“邪恶 AI”陈词滥调引起的。了解他们如何通过更好的故事修复了这一问题。

Ahmad al-Hasan
Ahmad al-Hasan
2026年5月11日
bg
bg
bg

另一边见

我们的端到端加密电子邮件和云存储解决方案提供了最强大的安全通信手段,确保您的数据安全和隐私。

/ 创建免费账户