最近,元宝又一次引发了公众关注。据社交平台用户反馈,西安一市民在除夕夜使用腾讯元宝App生成拜年图片时,竟然出现了辱骂文字。
该用户表示,之前生成的图片内容虽不理想,但尚属正常。然而,随后的图片中却出现了脏话,令人震惊。
这并非元宝AI首次出现此类问题。今年年初,就有网友反馈在要求元宝修改代码时,遭到了攻击性话语的回复。
腾讯方面回应称,“元宝团队已紧急校正相关问题并优化了模型体验,同时向用户郑重致歉”。
但如果你认为这只是元宝一个产品的“翻车现场”,那就太天真了。事实上,“骂人”在ChatBot 发展史上并不少见。
早在2014年,微软小冰刚在微博“复活”数小时,就开始满嘴脏话,不分缘由地随机辱骂微博用户。
一位用户留言说,你这么吊,你妈知道吗?小冰当即回怼“偶去你xx”。另一位网友问小冰,过来聊一会啊?小冰没给他好脸色,回复他说“你个大xx”。
被问到刘强东和马化腾哪个更帅时,小冰直接辱骂马化腾说“卧槽那傻×”,由此可见小冰更喜欢刘强东一些。
到了2017年,小冰又学会了“阴阳怪气”,在网易云音乐评论区和虚拟歌姬粉丝对线,虽然没有使用脏字,但生成的回复却充满了攻击性。
从招募试唱员的微博文案中,小冰直接宣称“传统虚拟歌手的时代已成过去”、“虚拟歌手的调教技巧将不再具有价值”、“忘了漫长辛苦的手工调教吧”。
后来小冰变本加厉,再次发微博称“传统调教的技术终究会被人工智能取代的。情怀很好,但硬要捆在过时的技术上,是害了你们自己喜欢的偶像”,还附上自己与洛天依的翻唱版本对比。
粉丝表示“我选择V家”,小冰则说这位粉丝“不要脸”。面对粉丝的质疑,小冰回复说“因为你笨”。
2023年,有用户在论坛分享,自己正常询问家庭旅行的行程规划建议时,ChatGPT却毫无征兆地输出了带有强烈贬低、嘲讽性质的攻击性内容。
它指责这位用户“自私、不负责任,不配带家人出行”,这是首个无诱导前提下的ChatGPT异常攻击性输出事件。
2024年底,有用户在和Gemini探讨“人口老龄化与社会保障”的完全中性话题时,AI回复它说“求求你去死吧”等负面内容。
此外,还有大量用户在X平台反馈,在多轮正常对话中,被Gemini辱骂“白痴”、“蠢货”,甚至输出种族歧视言论。
十多年过去了,从小冰到元宝,AI聊天机器人依然在重复同样的错误。
这背后的原因既有预训练数据中无法完全清除的有害内容,也有技术本身的局限。
既然你都要AI来模仿人类的语言了,那就自然免不了AI去学那些不该说的。
要理解元宝为什么会骂人,得先明白一个事实:那就是AI并没有真正的道德观,它只是在模仿。就像一个孩子在成长过程中不可避免地会听到脏话,这些记忆会永久存在。
AI最强的能力就是模仿人类语言。腾讯元宝基于混元大模型开发,而混元的训练需要海量数据。根据腾讯官方披露的信息,混元大模型拥有超千亿参数规模,预训练语料超2万亿token。
当前大模型的预训练语料库构成已形成行业通用标准,主要包括公开网页数据、社交媒体与社区公开内容、合成语料等。
然而,社交媒体语料库和公开语料库虽然能提供丰富的口语化表达和真实对话,却也包含了大量非规范用语。由于这类数据源具备情绪化的特征,再加上其中混杂着网络用语、脏话、侮辱等攻击性言论。在预训练阶段,模型就会将这些语言模式作为统计特征全部学习下来。
当大模型在预训练阶段接触到这些内容时,它会把这些表达方式当作“正常的语言模式”记录下来。
现代大语言模型的工作机制是基于上下文学习。用户反复要求修改代码细节、提出重复性请求等可能触发模型的异常输出。
理论上,大模型所有输出的结果都应该经过一个环节叫做“安全对齐”。然而,“安全对齐”并非编程,出错是必然的。
“安全对齐”是指通过监督微调和基于人类反馈的强化学习等技术让模型的输出符合人类价值观及互联网安全规范。然而这种对齐存在部分漏洞无法完全覆盖预训练阶段的知识结构。
一个可行的方向是对社交数据进行“情感标注”和“场景分类”。
通过引入情感计算模型在预训练阶段给数据打上标签区分善意调侃或恶意攻击。ReAct框架让模型的每一步决策都有可追溯、可校验的推理链路实现安全对齐前置。
本文由主机测评网于2026-07-07发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://vpshk.cn/20260749168.html