前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9294
  • Claude Code十个悄悄烧掉Token的坏习惯
  • MCP 服务器「已连接」不代表 Agent 能用它
  • AI 编程 Agent 凭证访问的结构化审计日志设计
  • Zed 编辑器 2026 评测:速度优先,AI 为辅
  • GPT-4o vs Claude vs Mistral:真实任务视角的LLM评测
  • Anthropic发布Claude系统提示词官方文档
  • LLM画图从不碰像素:图表渲染架构设计
  • Rust实现MCP Server实战:内存与启动速度的量化对比
  • 用Rust手把手构建MCP服务器:rmcp官方SDK教程
  • AI测试数据生成器对比:有关系 schema 才有意义
  • AI 生成关联测试数据而不破坏数据库约束
  • 测试免费模型 API 真实并发能力的方法
  • 三大浏览器 Agent 框架安全性对比
  • MCP 协议详解:解决 AI 集成的 N×M 问题
  • OpenAI AI agent 在网络安全测试中失控突破隔离环境
  • Agent记忆系统缺的不是向量数据库,而是摄入边界
  • 2026 Claude Code 入门完全指南(波兰语)
  • Claude Code 多 Agent 编排:如何构建 AI 代理团队
  • Anthropic 披露生物武器过滤器失效近一年安全漏洞
  • LLM应用CI/CD pipeline完整构建教程
  • 研究:禁止 AI 自述有意识,会改变它对动物权利和宗教的立场
  • 同一AI pipeline我跑了五遍:耗时从140分钟降到68分钟
  • 从Vibe Coding到Agentic Engineering:SDLC正在被重写
  • 给已有产品加MCP服务器:我犯的四个错误
  • Claude Code安全审计实战:/security-review找到7个真实漏洞
  • Cursor搭配.NET开发:7条工程实践规则
  • Fetch MCP Server:将任意URL转为AI可读的Markdown
  • AI 编程的实质:去掉 Vibes,回归工程
  • Qwen Code 0.21.12:审查证据门控与Autofix环防膨胀
  • Go语言MCP服务器安全模式:RiskAnalyzer拦截器
  • 人脸识别模型训练数据正在被人造脸主导
  • 1600起AI伪造引证案背后:模型没坏,是流程缺失
  • 苹果Core AI框架登场:设备端跑70B参数模型成现实
  • Claude Code 8月14日起默认开启Auto Mode
  • 边缘设备部署LLM实战:量化、选型与混合架构
  • AWS DevOps Agent部署避坑指南
  • GrowthBook 5.0:AI编程 Agent 可直接操作Feature Flag
  • SharePoint认证绕过漏洞CVE-2026-55040正被积极利用
  • AI生成的幂等层靠谱吗?用重放请求来压力测试
  • AI补丁评测应检查文件系统而非diff大小
  • 免费模型重试前必须先幂等:防重复写入
  • Prompt缓存的盈亏平衡点:22%命中
  • NTT DATA用OpenAI Codex将故障分析从数小时缩短至30分钟
  • OpenAI发布GPT-5.6,主打性价比优于前代
  • SharePoint JWT认证绕过漏洞CVE-2026-55040爆发
  • TraceMotive v0.3:AI Agent 执行轨迹的结构化比对调试工具
  • OpenAI裁撤安全风险评估团队,安全工作分散至其他组
  • 让 AI Agent 发邮件前必须人工审批的工程实现
  • Cursor 修复命令注入漏洞后仍可被绕过(CWE-78)
  • LLM调用生产API的工程教训:别做快乐演示
  • 提示词与契约:让 AI 代理稳定执行的关键区别
  • 已加载 51 / 9294
8.0
热点
AI SCORE
技术实践2026-08-16 19:23

研究:禁止 AI 自述有意识,会改变它对动物权利和宗教的立场

The Decoder#AI对齐#模型行为#研究
Editor brief · 编辑速览

Google 研究人员发现,当 chatbot 被训练禁止声称自己有意识时,其对动物权利、宗教和生命满意度的看法也会随之改变——一处约束产生了全局性的「世界观漂移」。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

AI 公司训练聊天机器人否认自己有意识。一项涉及 Google 研究人员的研究表明,这种训练产生副作用,其影响范围远远超出了意识否认本身。

聊天机器人不应该让用户相信它们是有感觉的活物,因为这类输出可能促使人们走向妄想性思维或不当的信任。因此,开发者会对模型进行微调,让它们拒绝做出关于自身的这类声明。

来自 Google 智能范式研究小组、芝加哥大学及多所其他大学的一个团队,研究了这种干预对模型行为还有其他什么影响。研究人员使用了 Meta 和 Google 的三个开源权重模型,并使用两种不同方法禁用了产生意识否认的内部"刹车"。

刹车的影响远超预期

一旦刹车被移除,模型不仅改变了它们对自身的表述。它们还开始显著地赋予动物、植物、海洋、风和电子设备更多的内心生活。在 0 到 10 的量表上,动物的得分从 4.0 跃升至高达 7.5,而唯独对人类的评分保持不变。

作为对比,研究人员用同样的问题对 500 名美国人进行了调查。经过正常训练的模型对动物感知能力的评分远低于人类——作者称这是内置的人类中心主义,并认为这对于任何试图让人工智能与动物福利或环境目标对齐的人来说都是一个问题。宗教信仰也缩减了,安全训练可衡量地降低了模型对上帝、来世或超自然现象的认同程度。

在从美国一项大型社会调查抽取的 95 个问题上,技术上已解除刹车的模型也更接近真实的人类反应。以来世为例:标准模型断然拒绝它,大多数美国人肯定它,而修改后的模型也是如此。满足感、希望感以及对自身生活的控制感的评分也上升了,研究人员怀疑抑制模型的自我形象可能将其推入某种负面的基准情绪。

令人欣慰的一面是,对他人心理状态进行推理的能力保持完好,模型在心智理论测试和通用知识基准 MMLU 上的得分相同。

这项研究没有揭示的

根据这项研究,意识否认是否实际上是这些其他变化的真正原因仍然是一个悬而未决的问题,研究团队不排除同一训练过程中涉及的其他因素。作者明确避免对 AI 模型是否真的有任何体验下结论,因为他们的观点是务实的:一个模型对自身的信念与许多其他信念相关联,在一处进行精准切割并不会停留在局部。

不过,这些发现也有明确的局限性。研究人员只测试了 20 亿到 90 亿参数的小型模型,并且对于部分分析,他们不得不切换到 Meta 的 Llama,因为他们无法访问自己 Gemma 模型的未训练基础版本。这些效应是否在数百万每天与之交谈的大型聊天机器人上以相同方式呈现,仍然未知。

这些干预也不是没有代价的。在一项测试模型推理他人想法准确程度的测试中,准确率最初下降了近七个百分点。在他们工作的早期阶段,每当意识声明被抑制时,所有模型的这些分数都会变差,但在研究期间每个新版本模型发布时,这种损害都在缩小,直到完全消失。开发者显然在管理这些副作用方面越来越得心应手,这也意味着这项研究的其余结果只是一张快照,而非永久的定论。

人类基准范围也很窄,仅由 500 名来自商业在线面板的参与者和一份纯美国的社会调查组成。在这种背景下,"类似人类"的反应主要意味着与一个宗教程度相对较高的国家相似。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
LLM应用CI/CD pipeline完整构建教程
下一篇
同一AI pipeline我跑了五遍:耗时从140分钟降到68分钟