0

0

刚刚曝光的 Claude3,直击 OpenAI 最大弱点

PHPz

PHPz

发布时间:2024-03-10 08:07:25

|

1090人浏览过

|

来源于IT之家

转载

企业级 sota 大模型,anthropic 的 claude3 释放了哪些信号?

作者 | 宛辰

编辑 | 靖宇

作为 OpenAI GPT3 研发负责人的创业项目,Anthropic 被视为最能与 OpenAI 抗衡的一家创业公司。

Anthropic在当地时间周一发布了一组Claude 3系列大模型,声称其功能最强大的模型在各种基准测试中都胜过了OpenAI的GPT-4和Google的Gemini 1.0 Ultra。

但是,能处理更复杂的推理任务、更智能、更快响应,这些跻身大模型 Top3 的综合能力只是 Claude3 的基本功。

Anthropic 致力于成为企业客户的最佳拍档

这是首先体现在 Claude3 是一组模型:Haiku、Sonnet 和 Opus,让企业客户根据自身场景选择不同性能、不同成本的版本。

其次,Anthropic 强调自家模型是最安全的。Anthropic 总裁 Daniela Amodei 介绍,在 Claude3 的训练中引入了一种叫做「宪法人工智能」的技术,增强其安全、可信、可靠

爱丁堡大学大模型和推理方向博士生符尧在阅读完Claude3的技术报告后指出,Claude3在复杂推理的基准测试中表现出色,尤其在金融和医疗领域表现突出。作为一家ToB公司,Anthropic选择专注于优化最具盈利潜力的领域。

现在,Anthropic 在 159 个国家开放使用 Claude3 系列的两款模型(Haiku 和 Sonnet),最强版本 Opus 也即将推出。同时,Anthropic 也通过亚马逊和谷歌的云平台提供服务,后者曾分别向 Anthropic 注资 40 亿美元和 20 亿美元

刚刚曝光的 Claude3,直击 OpenAI 最大弱点
联合创始人 Dario Amodei and Daniela Amodei 表示,Claude 3 的发布再次表明,「Anthropic 更像是一家企业公司,而不是一家消费者公司。」|图片来源:Anthropic

01、更智能、响应更快的 Claude3 家族:Opus、Sonnet 和 Haiku

据 Anthropic 官网,Claude3 是一系列模型,包含三种最先进的模型:Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus,允许用户为其特定应用选择智能、速度和成本的最佳平衡。

在模型的通用能力上,Anthropic 称 Claude 3 系列「为广泛的认知任务树立了新的行业基准」,在分析和预测、细致内容的生成、代码生成以及西班牙语、日语和法语等非英语语言对话方面,现实出更强大的能力,在任务响应上也更及时。

其中,Claude 3 Opus 是这组模型中最智能的模型,尤其在高度复杂的任务处理上。Opus 在大多数常见的评测基准中都优于同行,包括本科水平专家知识 (MMLU)、研究生水平专家推理 (GPQA)、基础数学 (GSM8K) 等。它在复杂任务上表现出接近人类水平的理解力和流畅性,是目前 Anthropic 对于通用智能最前沿的探索,「展示了生成式人工智能的外部极限」。

刚刚曝光的 Claude3,直击 OpenAI 最大弱点
Claude3 模型家族|图片来源:Anthropic

Claude 3 Sonnet 在智能水平和响应速度之间实现了理想的平衡,尤其对于企业场景下的任务。与同类产品相比,它以更低的成本提供了强大的性能,并且专为大规模人工智能部署中的高耐用性(high endurance)而设计。对于绝大多数工作负载,Sonnet 的速度比 Claude 2 和 Claude 2.1 快 2 倍,且智能水平更高。它擅长执行需要快速响应的任务,例如知识检索或销售自动化。

Claude 3 Haiku 是最紧凑的模型,并且也最具成本效益。并且,它的响应速度也很快,可以在不到三秒的时间内阅读 arXiv 上包含图表、图形的信息以及数据密集的研究论文(约 10k token)。

Sesame AI
Sesame AI

一款开创性的语音AI伴侣,具备先进的自然对话能力和独特个性。

下载

02、瞄准企业客户的迭代

联合创始人 Daniela Amodei 介绍,除了通用智能的进步,Anthropic 特别关注企业客户把生成式 AI 集成到他们的业务时,所面临的许多挑战。针对企业客户,Claude3 家族在视觉能力、准确性、长文本输入和安全方面,都有进步。

很多企业客户的知识库拥有多种格式,PDF、流程图或演示幻灯片。现在,Claude 3 系列模型可以处理各种视觉格式的内容,包括照片、图表、图形和技术图表。

Claude3 还优化了准确性和长文本窗口的能力。

在准确性上,Anthropic 使用了大量复杂的事实问题来针对当前模型中已知的弱点,将答案分为正确答案、错误答案(或幻觉)和承认不确定性。相应地,Claude3 模型表示它不知道答案,而不是提供不正确的信息。其中最强的版本 Claude 3 Opus 在具有挑战性的开放式问题上的准确性(或正确答案)上,比 Claude 2.1 提高了一倍,同时也减少了错误答案的水平。

刚刚曝光的 Claude3,直击 OpenAI 最大弱点
相比 Claude2.1 版本,Claude3 系列全面提升了响应的准确性。|图片来源:Anthropic

同时,由于语境理解能力的提升,Claude3 家族相比之前的版本,在响应用户任务上会作出更少的拒绝回答。

除了更准确的回复,Anthropic 称将在 Claude 3 带来「引用功能,可以指向参考材料中的精确句子来验证他们的答案

当前,Claude 3 系列模型将提供 200K token 的上下文窗口。后续,所有这三种模型都能够接受超过 100 万 token 的输入,这部分能力会提供给需要增强处理能力的精选客户。Anthropic 在技术报告中简单阐述了 Claude3 的上文本窗口能力,包括有效处理更长的上下文提示词,以及回忆能力。

03、「宪法人工智能」,应对「不精确的科学」

值得注意的是,Claude3 作为多模态模型,可以输入图像,但无法输出图像内容。联合创始人 Daniela Amodei 称,这是因为「我们发现企业对图像的需求要少得多」。

Claude3 的发布是在谷歌 Gemini 生成图片引发争议后发布的,面向企业客户的 Claude 也免不了在 AI 所引发的价值观偏见等问题上的控制与平衡。

对此,Dario Amodei 强调了控制人工智能模型的难度,称其为「不精确的科学」。他表示,该公司有专门的团队致力于评估和减轻模型带来的各种风险。

另一位联合创始人 Daniela Amodei 也承认,用目前的方法可能无法实现完全无偏见的人工智能。「创建一个完全中立的生成式人工智能工具几乎是不可能的,不仅在技术上,而且还因为并不是每个人都同意什么是中立。」她说。

刚刚曝光的 Claude3,直击 OpenAI 最大弱点
此前,Anthropic 公布了用来对齐大模型的「宪法人工智能」|图片来源:Anthropic

尽管如此,Anthropic 用一种称为「宪法人工智能」方法来尽可能使模型和人类广泛的价值观一致,模型遵循「宪法」中定义的原则来调整优化。

作为 OpenAI 曾经的核心人发人员,Amodei 兄妹的出走跟近日马斯克对 OpenAI 的一纸诉状有相同点,认为 OpenAI 不再是一个非赢利组织,不再遵循最初使命造福人类。有记者问 Amodei,Anthropic 符合你出走创业的愿景吗?

Amodei 说:「处于人工智能发展的前沿,是引导人工智能发展轨迹为社会带来积极成果的最有效方式。」

本文来自微信公众号:极客公园 (ID:geekpark),作者:宛辰

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
登录token无效
登录token无效

登录token无效解决方法:1、检查token的有效期限,如果token已经过期,需要重新获取一个新的token;2、检查token的签名,如果签名不正确,需要重新获取一个新的token;3、检查密钥的正确性,如果密钥不正确,需要重新获取一个新的token;4、使用HTTPS协议传输token,建议使用HTTPS协议进行传输 ;5、使用双因素认证,双因素认证可以提高账户的安全性。

6607

2023.09.14

登录token无效怎么办
登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容,供大家免费下载体验。

842

2023.09.14

token怎么获取
token怎么获取

获取token值的方法:1、小程序调用“wx.login()”获取 临时登录凭证code,并回传到开发者服务器;2、开发者服务器以code换取,用户唯一标识openid和会话密钥“session_key”。想了解更详细的内容,可以阅读本专题下面的文章。

1092

2023.12.21

token什么意思
token什么意思

token是一种用于表示用户权限、记录交易信息、支付虚拟货币的数字货币。可以用来在特定的网络上进行交易,用来购买或出售特定的虚拟货币,也可以用来支付特定的服务费用。想了解更多token什么意思的相关内容可以访问本专题下面的文章。

2134

2024.03.01

PHP 命令行脚本与自动化任务开发
PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境(CLI)下的开发与应用,内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理,以及与 Linux 定时任务(Cron)的结合使用。通过实战示例,帮助开发者掌握使用 PHP 构建 自动化脚本、批处理工具与后台任务程序 的能力。

66

2025.12.13

Go高并发任务调度与Goroutine池化实践
Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开,系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示,帮助开发者构建稳定高效的 Go 并发任务处理系统,提高系统在高负载环境下的处理能力与稳定性。

22

2026.03.10

Kotlin Android模块化架构与组件化开发实践
Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开,重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析,帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系,提升团队协作效率与项目迭代速度。

48

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

93

2026.03.06

Rust内存安全机制与所有权模型深度实践
Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开,深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例,分析内存安全保障原理与零成本抽象优势,并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学,掌握在高性能与安全性并重场景中的工程实践能力。

216

2026.03.05

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
麻省理工大佬Python课程
麻省理工大佬Python课程

共34课时 | 5.5万人学习

国外Web开发全栈课程全集
国外Web开发全栈课程全集

共12课时 | 1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号