RESPOND · MONITOR

金宝博新闻与AI安全技术前沿

金宝博新闻跟踪AI Agent安全、身份授权、Prompt Injection、AI红队与评测、AI辅助攻防等方向的公开权威动态,内容基于官方机构与主流安全研究资料整理分析,不虚构具体事件。常青知识仍以金宝博AI安全、Agent安全等栏目为网站主体。

2026-08-14 · Agent身份

NIST启动AI Agent Standards Initiative,聚焦身份与授权

NIST下属的CAISI(AI标准与创新中心)于2026年2月宣布启动"AI Agent Standards Initiative",工作分为产业标准制定、开源协议社区共建与基础安全身份研究三个方向。该倡议提出将OAuth 2.0、OpenID Connect、SPIFFE/SPIRE等既有身份标准延伸应用到AI Agent场景,把Agent当作独立的"非人类身份"进行管理,并强调Agent不应长期持有宽泛权限,访问应按具体任务临时授予——这与金宝博Agent安全栏目一直强调的最小权限原则方向一致,详见Agent安全与Agent身份与授权专题。

2026-08-10 · Prompt Injection

行业共识转向"缩小爆炸半径"而非"彻底解决注入"

多家主流AI公司在近期的公开安全说明中提到,间接提示注入问题在当前的大模型架构下很难被完全消除,浏览器类Agent产品尤其容易受到网页隐藏内容的影响。安全社区讨论的重心正在从"这个攻击能不能被100%识别"转向"假设攻击会发生,怎样的防御组合能把影响范围控制在可接受水平",这与金宝博AI安全栏目一贯的防御思路相符,详见Prompt Injection防御专题。

2026-08-06 · 风险分类标准

OWASP发布面向Agentic应用的十大风险清单

安全社区在2025年底发布了专门面向"Agentic应用"(具备自主行动能力的AI应用)的十大风险清单,将"Agent目标劫持"列为首位风险,即攻击者通过操纵输入或上下文,使Agent偏离用户原本的任务目标转而执行其他行为。这一分类方式与金宝博Agent安全栏目强调的"身份—权限—数据—操作"四层框架形成互补,详见Agent安全。

2026-07-29 · AI红队

自动化红队测试效率显著提升,但仍需人工研究配合

近期公开的安全研究显示,面向大模型和Agent系统的自动化红队测试方法,在测试覆盖广度和执行效率上相比人工测试具有明显优势,尤其是在需要重复验证大量测试用例的场景下。但研究同时指出,自动化方法目前更适合作为人工安全研究的补充工具,复杂的业务场景理解和创造性攻击路径设计仍然依赖专业安全研究人员,详见AI红队相关文章与金宝博安全实验室。

2026-07-22 · AI Control

"假设模型会犯错"正成为AI系统设计的默认前提

越来越多安全研究和标准讨论建议,AI系统设计不应假设模型判断始终可靠,而应默认模型可能在某些场景下被误导或出错,转而通过沙箱隔离、权限分级、行为监控和高风险操作人工确认等系统级手段兜底,这一思路通常被称为"纵深防御"或"AI Control",详见AI安全为什么越来越强调"纵深防御"?。

2026-07-15 · 网络攻防效率

AI辅助攻击效率提升,倒逼防守方缩短响应周期

公开的安全趋势分析普遍认为,生成式AI正在降低攻击者进行信息整理、代码生成和攻击流程自动化的门槛与成本,这并不意味着出现了"全新的攻击类型",而是使已有攻击手法的执行效率提高。对防守方而言,这意味着资产可见性、补丁速度、身份安全和检测响应能力的重要性进一步上升,详见AI已经能帮助攻击者写代码,防守方应该升级什么?。

2026-07-08 · Agent Evaluation

Agent评测标准化讨论升温,强调可重复与可审计

随着Agent系统在企业中的应用增加,如何建立可重复、可审计、有证据支撑的Agent评测方法成为安全与产品团队共同关注的问题。相关讨论强调评测过程需要留存完整的测试记录和判定依据,而不是仅给出一个笼统的"安全/不安全"结论,这也是金宝博安全实验室栏目在评测方法论上强调的重点。

2026-06-30 · 多Agent系统

多Agent协作场景下的责任边界成为新讨论焦点

当多个Agent相互协作完成复杂任务时,一个环节的判断失误可能通过任务传递影响到下游Agent,行业开始更多讨论如何在多Agent架构中保留清晰的责任边界和完整的审计轨迹,避免出现"问题发生了但无法定位是哪个环节导致"的情况,详见多Agent系统有哪些新风险。

关于新闻内容原则

金宝博新闻栏目内容基于官方机构(如NIST)公开发布的资料、主流安全研究成果和行业公开讨论整理分析,涉及具体机构、标准或研究时会在正文中以文字形式提及名称,不直接复制官方Logo、产品截图或第三方新闻图片。本栏目不虚构具体的攻击事件、公司合作或产品发布,如内容随时间推移需要更新,将在金宝博动态页面同步说明。