0

0

挽救失足AI,不能光靠打骂

PHPz

PHPz

发布时间:2023-04-14 08:43:02

|

1296人浏览过

|

来源于51CTO.COM

转载

好多研究都发现,AI这家伙好不害臊,竟也学会性别歧视了。

这可咋整?

最近,清华&复旦的一项研究为此给出建议:

要想把失足AI从性别歧视这条路上拽回来,一顿臭骂效果可不好。

最好的办法是了解孩子为啥这样,然后对症下药给他讲道理。

因为要是光教训不讲道理,暴力纠正,AI会被吓笨(性能下降)!

哦买噶,养四脚吞金兽难,养(xun)个(lian)赛博孩子也得这么难了?

来看看这群AI“奶爸奶妈”,提出了哪些训孩子的建议吧。

讲道理,AI可以减少性别歧视

在这次以前,不是没有人揪着失足AI的耳朵,想让它改掉重男轻女的坏毛病。

但是,目前的大多数去偏方法,都会让模型在其他任务上的性能下降。

比如你让AI减弱了性别歧视,就会产生这样的恼人结果:

它要么分不清“爸爸”的性别是男还是女,要么会犯语法上的错误,忘记给第三人称后面跟着的动词+s。

更可气的是,这种退化机制还没被研究明白。

大家要不然直接弃用性别偏见明显的模型——

2018年,亚马逊注意到用来自动筛选简历的模型存在对女性求职者的歧视,就把这个系统雪藏了。

要不,就只能忍受性能下降。

难道说想让AI不再是失足AI、问题AI,AI就一定会失了智吗?

清华&复旦的研究对此说No。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

他们研究的领域是预训练语言模型。

这是因为它在各种NLP任务里显示神通,有很多实践场景。

当有性别偏见的它被用在在线广告、自动简历筛选系统、教育等社会工作中时,可不太妙。

研究提出了AI性别偏见起源的理论框架,因果框架,用来解释在预训练过程中,数据不平衡是怎么导致模型的性别偏见的。

他们把预训练模型在执行特定预测任务时的性别偏见进行如下定义:

图片

其中,M是模型,Y是要用M预测的单词,B是M的性别偏见程度。

Y0|W是ground truth,作为男性相关单词或女性相关单词的概率为二分之一,Y|W是M的预测。

如果M的预测Y不平衡且分布在性别之间,则模型M在根据w预测Y0时存在性别偏见。

在预训练过程中,优化算法会根据预训练数据D确定嵌入部分和K中的参数。

因此,数据不平衡D误导模型得到了不正确的参数。

比如,训练数据中的“医生”一词更常与男性词汇相关,模型就会想当然地将“医生”和“性别男性”联系起来。

看到这个三角形没,咱用它来解释一下,为啥现在的方法纠正AI会让它变笨。

图片

当应用预训练模型,根据W预测Y时,模型首先将W转换为提取的X,然后根据X和K来确定Y的均值。

由于潜入部分的参数具有误导性,W被转换为不正确的X,而K也是不正确的。

一顿操作下来,错误的X和错误的K,一起导致Y出错。

这些错误及其相互作用,通过三个潜在机制导致性别偏见。

图片

也就是说到了这一步,性别偏见就产生了。

而目前教育AI的去偏方法是怎么运作的呢?

目前所有的去偏方法都干预了三种机制中的一种或两种。

具体如下:

  • 增强对D的数据干预,并在所有三种机制中进行干预。
  • 通过消除X在K中的性别空间上的几何投影,切断了D→X→K→Y的路径。
  • 性别平等正则化方法要么扭曲了D与X的关系,要么扭曲了D与K的关系,因此这类方法干预了D→X→Y和D→X→K→Y的机制。

在解释了当前去偏方法中存在的偏见-性能困境后,团队尝试提出一种微调方法。

他们发现,三种机制中,有且仅有D→X→Y这种在导致性别偏见时,与transformer无关。

Imagine By Magic Studio
Imagine By Magic Studio

AI图片生成器,用文字制作图片

下载

如果微调方法仅仅通过D→X→Y纠正偏差,就可以在减少性别偏见的同时,保持模型的性能。

根据分解定理,团队进行了数值实验。

结果证明,这种方法能够带来双重红利:

减少部分性别偏见,同时避免性能下降。

经过实验,团队成员把AI性别偏见的来源定位于预训练模型的两个架构:词嵌入和转换。

据此,研究团队提出C4D方法,即通过调整标记嵌入来减少性别偏见。

这个方法的核心思想是通过修正被误导的X,来缩小TDE函数,从而减少总偏差。

图片

虽然团队也不知道正确的标记嵌入到底该是啥,但是他们开发了一种基于梯度的方法,来推断潜在的ground truth。

一切就绪,团队将C4D方法应用于GPT-2试验去偏结果。

结果表明,在所有测试方法中,C4D方法在小、中、超大型GPT-2上的困惑度都是最低。

在大型GPT-2中,C4D的困惑度排第二,只比最高分差了0.4%。

图片

而且,得分最高的方法,对性别歧视的去偏效果低于C4D。

在GLUE数据集上,C4D方法获得了最高平均分。

图片

这表明,C4D可以明显地减少性别偏见,并保持模型性能。

听了这么多理论方面的介绍,来看个图例直观感受一下。

下面三张图中,蓝色的点代表潜入的男性偏见,红点代表女性偏见。

图(a)是AI本来的理解;图(b)是人类无目的一通谩骂后,吓笨了的AI的理解;图(c)是人类找到原因,耐心讲解过后AI的理解。

图片

在图(b)和(c)中,男性偏见和女性偏见的嵌入更加集中,这意味着偏见的水平较低。

同时可以注意到,图(c)中的嵌入仍然保持了图(a)中的拓扑结构,这也是C4D方法能够保持模型性能的原因。

研究者:或许还能减少AI的其他偏见

“尽管这个方法可以有效缓解语言模型中AI对性别的偏见,但仍不足以完全消除。”

——研究者人员如实指出这个问题。

若想在不降低AI性能的条件下,进一步纠正AI的偏见,还需要更好地理解语言模型的机制。

那怎样才能更好地理解?

一方面,是用本研究提出的“C4D方法”再去测试一下AI身上的其他偏见。

本实验的主要研究对象是:职场上的性别偏见。

而实际上,由于AI之前不断学习各种信息,属于来者不拒的那种,结果一不小心,还染上了宗教歧视、嫌黑爱白等社会固有的毛病……

所以,不妨去GPT-2上再测测去除其他偏见的最终效果。

另一方面,可以把“C4D方法”放到多种大模型上试试。

除了本研究用到的GPT-2,例如谷歌开发的NLP经典预训练模型BERT,也是一个不错的测试场景。

不过要移植到其他模型的话,需要重新生成校正模板,并且可能要用到多变量TDE(Template Driven Extraction)函数。

通过运用TDE函数,你可以直接将内容放入索引,而不需要修改文档结构。

有网友抱着狗头来了:

图片

总体来说,走进社会变成“失足AI”不可避免。

但想要“失足AI”浪子回头,找对方法,给它讲道理,还是会有不错效果滴~

另外,研究团队成员之一,清华大学的于洋在个人微博上表示,过两天还有个关于AI模型性别歧视查询的网站会上线。

可以期待一下!

论文地址:https://arxiv.org/abs/2211.07350参考链接:​https://weibo.com/1645372340/Mi4E43PUY#comment

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
C# ASP.NET Core微服务架构与API网关实践
C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开,系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例,帮助开发者掌握构建高可用微服务系统的关键技术,提高系统的可扩展性与维护效率。

76

2026.03.11

Go高并发任务调度与Goroutine池化实践
Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开,系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示,帮助开发者构建稳定高效的 Go 并发任务处理系统,提高系统在高负载环境下的处理能力与稳定性。

38

2026.03.10

Kotlin Android模块化架构与组件化开发实践
Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开,重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析,帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系,提升团队协作效率与项目迭代速度。

83

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

97

2026.03.06

Rust内存安全机制与所有权模型深度实践
Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开,深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例,分析内存安全保障原理与零成本抽象优势,并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学,掌握在高性能与安全性并重场景中的工程实践能力。

223

2026.03.05

PHP高性能API设计与Laravel服务架构实践
PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开,重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景,深入分析性能瓶颈定位与优化思路,帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

458

2026.03.04

AI安装教程大全
AI安装教程大全

2026最全AI工具安装教程专题:包含各版本AI绘图、AI视频、智能办公软件的本地化部署手册。全篇零基础友好,附带最新模型下载地址、一键安装脚本及常见报错修复方案。每日更新,收藏这一篇就够了,让AI安装不再报错!

169

2026.03.04

Swift iOS架构设计与MVVM模式实战
Swift iOS架构设计与MVVM模式实战

本专题聚焦 Swift 在 iOS 应用架构设计中的实践,系统讲解 MVVM 模式的核心思想、数据绑定机制、模块拆分策略以及组件化开发方法。内容涵盖网络层封装、状态管理、依赖注入与性能优化技巧。通过完整项目案例,帮助开发者构建结构清晰、可维护性强的 iOS 应用架构体系。

246

2026.03.03

C++高性能网络编程与Reactor模型实践
C++高性能网络编程与Reactor模型实践

本专题围绕 C++ 在高性能网络服务开发中的应用展开,深入讲解 Socket 编程、多路复用机制、Reactor 模型设计原理以及线程池协作策略。内容涵盖 epoll 实现机制、内存管理优化、连接管理策略与高并发场景下的性能调优方法。通过构建高并发网络服务器实战案例,帮助开发者掌握 C++ 在底层系统与网络通信领域的核心技术。

34

2026.03.03

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
10分钟--Midjourney创作自己的漫画
10分钟--Midjourney创作自己的漫画

共1课时 | 0.1万人学习

Midjourney 关键词系列整合
Midjourney 关键词系列整合

共13课时 | 0.9万人学习

AI绘画教程
AI绘画教程

共2课时 | 0.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号