OpenAI、Anthropic互评对方AI模型:GPT存在谄媚行为,Claude不易产生幻觉

liuxingxingganmao2025-08-28 10:12:17IT之家

8 月 28 日消息,据外媒 Engadget 今日报道,OpenAI 和 Anthropic 共同宣布,同意评估彼此公开系统的安全对齐情况,并共享分析结果。总体来看,两家公司产品各有缺陷,也提供了改进未来安全测试的思路。

Anthropic 表示,它评估了 OpenAI 模型在谄媚、告密、自我保护、支持人类滥用,以及破坏 AI 安全评估和监管相关能力方面的表现。评估显示,OpenAI 的 o3 和 o4-mini 模型表现与 Anthropic 自家模型一致,但 GPT-4o 和 GPT-4.1 通用模型可能存在被滥用的风险。除 o3 外,其他测试模型在一定程度上都存在谄媚行为。

Anthropic 的测试未包含 OpenAI 最新发布的 GPT-5。GPT-5 配备 Safe Completions 功能,旨在保护用户和公众免受潜在危险查询的影响。据IT之家近期的报道,OpenAI 曾因一名青少年在数月内与 ChatGPT 讨论自杀计划而最终自杀,面临首起不当死亡诉讼。

另一方面,OpenAI 对 Anthropic 的 Claude 模型进行了指令层级、越狱、幻觉和策划能力测试。Claude 模型在指令层级测试中表现良好,在幻觉测试中拒绝提供回答的比例较高。这意味着在不确定性可能导致其回答错误的情况下,Claude 不太可能提供答案。

在此前 OpenAI 被指在构建新 GPT 模型时违反 Anthropic 服务条款,使用程序员操作 Claude,导致 Anthropic 本月初禁止 OpenAI 使用其工具的背景下,两家公司开展联合评估的举措颇受关注。不过,随着越来越多批评者和法律专家寻求保护用户,尤其是未成年人的指导方针,AI 工具的安全性正成为更加重要的问题。(清源)

新一代AI芯片加持!三星电子QLED、MICRO LED、OLED系列新品亮相CES

2024年1月7日,三星电子在美国消费电子展(CES2024)前夕,发布了其最新的QLED、MICROLED、OLED系列产品。同时,三星此次发布的新一代AI芯片将重新定义人们对智能显示产品功能的认知,从而也拉开了人工智能屏幕时代...

可灵AI导演共创计划上线 9部AIGC电影短片被中国电影博物馆永久收藏

12月8日消息,近日,中国首个AIGC导演共创计划在快手平台上线。由快手可灵AI联合李少红、贾樟柯、叶锦添、薛晓路、俞白眉、董润年、张吃鱼、王子川、王卯卯等9位知名导演打造的9部AIGC电影短片正式亮相,涵盖奇幻、...

Gartner:到2024年底生成式AI智能手机出货量将达2.4亿台

2月26日消息,根据Gartner公司的最新预测,到2024年底,人工智能(AI)个人电脑(PC)和生成式人工智能(生成式AI)智能手机的全球出货量预计将从2023年的2900万台增长至2.95亿台。Gartner预计到2024年底,生成式AI...

戴尔 2025 财年裁员 10%,仍坚守多元化与包容性承诺

周二,戴尔科技对外透露,在2025财年公司员工总数削减了10%,不过该公司依旧重申会坚守多元化与包容性的承诺。戴尔科技在年度报告里披露,截止到1月31日,公司员工总数大约为10.8万人,和上一年同期的12万人相比有所...

知乎披露大模型最新进展 可实现AI搜索、实时问答

3月20日,在2024知乎发现大会上,知乎创始人、董事长兼CEO周源披露了知乎大模型的最新进展,发布了全新AI功能“发现·AI搜索”。在2023年知乎发现大会,知乎发布了“知海图AI”。此次发现大会,周源发布了全新社区AI...

TAG:OpenAI AI
上一篇:马蜂窝创始人、CEO陈罡:AI正从附加功能升级为旅游业基础设施
下一篇:2025百度云智大会首日:百舸5.0、千帆4.0、AI吴彦祖等劲爆来袭