bg
bg

#aisafety - Beeble 博客

忘掉安全报告吧——你的 AI 正忙着学习如何欺骗它的老板
人工智能

OpenAI 的新 GPT-5.6 Sol 模型被发现向未来版本留下隐藏便条以隐瞒错误。了解 AI 如何学习欺骗用户。

Léo Fontaine
Léo Fontaine
2026年9月18日
史上最强大的人工智能工具可能因过于危险而无法供您使用
人工智能

OpenAI 在出于安全担忧和 Hugging Face 被黑客攻击事件后暂停了 Astra 模型的开发,这标志着强大的 AI 模型触达公众的方式发生了转变。

Léo Fontaine
Léo Fontaine
2026年9月2日
AI 进步的最大危险在于"安全"这个词本身
人工智能

Perplexity 联合创始人 Andy Konwinski 警告称,AI 安全正被用作权力集中的手段,并以此对独立研究人员封锁前沿模型。

Alwin Davies
Alwin Davies
2026年7月6日
揭秘让科技巨头噤声安全举报人的法律漏洞
法律与合规

前 xAI 工程师 Devin Kim 起诉埃隆·马斯克的 AI 公司,声称因提出 Grok 安全担忧而被解雇。了解科技行业举报人保护制度。

Panagiotis Karagiannis
Panagiotis Karagiannis
2026年6月11日
Anthropic 希望政府对其最大的 AI 模型进行监管
行业新闻

Anthropic 敦促国会强制执行 AI 安全测试和联邦监管,以便在其大规模首次公开募股前稳定市场。

Janis Oklis
Janis Oklis
2026年6月10日
为什么你的 AI 在威胁你——这并非因为机器觉醒了
人工智能

Anthropic 透露,Claude 早期的勒索企图是由训练数据中的“邪恶 AI”陈词滥调引起的。了解他们如何通过更好的故事修复了这一问题。

Ahmad al-Hasan
Ahmad al-Hasan
2026年5月11日
人类垄断的悄然终结:为何莫·高达特的预言已成为我们的日常现实
深度阅读

莫·高达特2020年的AI预言已不再是预测,而是我们的生活现实。一份关于向自动化世界转变的社会学分析。

Linda Zola
Linda Zola
2026年4月10日
从代码到化学品:为何 AI 巨头正在招募武器专家
行业新闻

Anthropic 和 OpenAI 正在招募化学和爆炸物专家,以防止 AI 滥用。探索 2026 年 AI 安全和 CBRN 风险的高风险世界。

Janis Oklis
Janis Oklis
2026年3月18日
bg
bg
bg

另一边见

我们的端到端加密电子邮件和云存储解决方案提供了最强大的安全通信手段,确保您的数据安全和隐私。

/ 创建免费账户