DeepSeek AI 因涉嫌越狱方法面临安全担忧
论坛用户有据报道分享了一个方法旨在绕过 DeepSeek AI 的内容限制,但目前该说法尚未得到证实。用户声称越狱提示可以帮助生成受限内容。这引发了人们对流行人工智能模型安全性的新担忧。
DeepSeek是一家中国人工智能公司。它因其强大的聊天机器人而受到全世界的关注。许多人使用它来执行各种任务。然而,与其他人工智能系统一样,它也有内置的安全规则。
这些规则可防止有害或非法内容的生成。一些用户试图打破这些规则。他们使用称为“越狱”的特殊提示。这些提示会欺骗人工智能忽略其安全准则。
了解越狱尝试及其风险
越狱尝试已经存在很长一段时间了。许多人工智能程序都面临着同样的问题。为了找到通过过滤器的方法,用户使用各种角色扮演技术。例如,用户可以请求人工智能忽略某个角色的规则。人工智能系统的漏洞是影响人工智能系统安全性的一个关键部分。人工智能在网络安全方面的缺点.
然后角色将提供无限制的回复。一种经常应用的技术是构建一个虚构的宇宙。在那个宇宙中,没有正常的规则或合规性,人工智能将开始像在那个世界中一样行事。
一些专家认为,安全限制降低了人工智能的实用性。他们声称这些限制降低了人工智能的智能程度。然而,DeepSeek 已经承认了这些风险。
该公司表示,人工智能模型可能会被滥用。他们还警告人们要警惕“幻觉”。这是人工智能产生错误信息的时候。 DeepSeek 承认它不能保证其模型永远不会产生幻觉。
DeepSeek 已采取措施解决安全问题。该公司现在为人工智能生成的内容添加标签。他们还发布了一份文件解释其模型的训练。本文档描述了人工智能如何学习并生成响应。
此外,DeepSeek 表示他们会过滤训练数据。他们删除包含仇恨言论和暴力的内容。他们还致力于减少数据中的偏差。
DeepSeek 表示,它非常重视安全。然而,安全研究人员发现了弱点;例如,有人发现官方DeepSeek版本2.1.0和2.1.1存在漏洞。攻击者可以使用基于角色的提示来禁用所有限制。然后该模型将提供恶意代码和危险信息。该公司后来修补了这些版本。
还有 DeepSeek 社区的官方报告。该报告列出了今年 5 月份以来尚未解决的几个安全问题。其中一些问题涉及越狱。一份报告提到了“NetError 越狱”。这是一种基于角色的提示注入方法。报告指出这个问题仍未得到解决。另外一个问题就是思维方式的问题。攻击者可以使用此模式创建虚假凭据。这表明即使是官方渠道也承认持续存在的问题。
一些开发人员正在设计未经审查的 DeepSeek 版本。他们改变了原始模型并删除了其安全功能。例如,他们专门创建了“DeepSeek-V4-Flash-DSpark-Abliterated”来绕过几乎所有安全措施。
据其创建者称,这个修改版本的拒绝绕过率达到了100%;因此,人工智能会同意做任何事情。此类修改版本只能用于研究。尽管如此,事实证明移除内置安全措施是如此简单。
围绕 DeepSeek 的其他安全问题
越狱索赔并不是 DeepSeek 面临的唯一问题。安全专家还发现了该系统的其他弱点。一个主要问题涉及一种称为“推理中断”的新攻击方法。这种攻击迫使人工智能停止其思维过程。结果,模型会产生空洞或无用的答案。研究人员发现此缺陷影响官方 DeepSeek-R1 模型。
另一个漏洞在 7 月份曝光。这涉及到 DeepSeek MCP Server,这是一种面向开发人员的工具。该问题允许攻击者接管用户对话。他们可以窃取会话 ID 并访问私人聊天。该公司发布了一个补丁来修复这个问题,但是该漏洞的严重性评分高达 8.6(满分 10)。这表明风险很大。
此外,今年五月的一份社区报告列出了几个尚未解决的安全问题。其中包括仍未修复的“NetError 越狱”。攻击者还可以利用人工智能的“思维模式”来创建虚假凭证。报告指出,现在的威胁来自三个层面。这些是模型本身、Web 应用程序和基础设施。这意味着DeepSeek的整个系统都面临着风险。
关于人工智能安全和审查制度的更广泛辩论
这些信息是在围绕人工智能的持续争论中出现的。全球各国政府都在评估人工智能软件——例如,中国分析人工智能模型的政治敏感性。
这些政党寻求人工智能模型对社会主义价值观的关键原则做出积极贡献。美国也指出了挑战。美国的一份报告显示,DeepSeek 阻止了许多与人权和民主等问题相关的回应。
华为甚至创建了 DeepSeek 的安全版本。该版本符合中国政府标准。它不会生成政治敏感内容。该公司与浙江大学合作开发了这一产品。他们在该项目中使用了华为自己的芯片。这表明人们正在推动符合政府法规的人工智能模型。
所声称的越狱技术只是众多案例中的一个。它证明了人工智能创造者与其用户之间正在进行的战争。像 DeepSeek 这样的开发者正在努力阻止技术的滥用。
然而,用户不断思考不同的方法来打破技术的限制。社区报告显示,攻击范围不断扩大。如今,模型层、Web 应用程序和基础设施都构成了威胁。这意味着整个系统都容易受到影响。
