前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8629
  • iPhone 17 成功运行 400B 大模型演示
  • 用 Claude 自动化移动应用 QA 测试
  • 现代 LLM 注意力机制可视化教程
  • OpenTelemetry 统一 LLM 追踪规范
  • OpenCode:开源 AI 编程 Agent 项目
  • 快速构建领域特定嵌入模型
  • 初次体验 Agent 技能开发
  • 一小时用 AI 快速原型应用
  • Gemini CLI 高级功能全解
  • 用四象限图判断 AI 技术价值
  • 企业级 MCP 应用案例分析
  • AI 术语速成手册
  • Meta AI 失控事件警示录
  • Google AI Studio 快速编程秘诀
  • 轻量级TTS模型库:25MB以内可直接嵌入
  • 用Markdown声明式构建生成式UI交互
  • OpenAI收购Astral:Python工具栈并购
  • OpenAI官宣收购Astral团队
  • Cook:编排Claude Code的轻量级CLI工具
  • Cursor Composer 2:前沿级AI编码能力升级
  • 无需训练!复制LLM参数层突破推理瓶颈
  • Claude Code 在工程领域的实战应用
  • AI 生成代码的保修和法律困境
  • Google Sashiko:Agent 式 AI 审查 Linux 内核
  • AI 生成代码引入的新型技术债
  • Colab MCP Server:AI Agent 的新连接方式
  • 自主运行的 Claude Code Agent:从工具到自主系统
  • Hugging Face 2026 春季开源生态报告
  • Antfly:用 Go 构建分布式多模态搜索系统
  • Holotron-12B:高吞吐量计算机自动化 Agent
  • 用 AI 自动生成技术规范文档
  • 用 MCP 为 AI 知识库接入 Notion
  • Claude Code Skills 官方实战指南:9 大类型与分发策略
  • Mistral 开源形式验证 Agent:提升代码可信性
  • 用 Claude Code Skills 完整开发 Godot 游戏
  • Apideck CLI:低消耗的 AI Agent 接口方案
  • 智能体工程进阶:从 Tab 补全到 Agent 团队的 8 个等级
  • LLM 架构可视化库:全景理解模型设计
  • Claude合作伙伴网络启动
  • Claude使用优惠活动
  • GitAgent:仓库变身AI代理的开放标准
  • Claude在3D创意工作中的实战技巧
  • Spine Swarm:可视化画布上的AI Agent编排
  • 大规模识别LLM的神经元交互机制
  • Claude Code与其他LLM的网关集成指南
  • VS Code官方:AI在自身开发流程中的应用
  • Understudy:演示一次即可教会的桌面Agent
  • OneCLI:生产级的AI Agent密钥管理库
  • Claude 新增交互式图表和可视化功能
  • AI 行业现状与未来走向分析
  • Axe:12MB 轻量级二进制替代重型 AI 框架
  • 已加载 51 / 8629
6.0
关注
AI SCORE
技术实践2026-03-19 05:31

无需训练!复制LLM参数层突破推理瓶颈

Hacker News · github.com#LLM优化#推理提升#参数复制
Editor brief · 编辑速览

研究发现在24B模型中复制3层参数,逻辑推理能力从22%跃升至76%,是廉价优化LLM的启发。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

复制 3 个层。无需训练。逻辑推理从 0.22 → 0.76。

这个工具包发现并利用隐藏在 transformer 模型内部的"推理电路"。核心思想:某些连续的层块作为不可分割的认知单元发挥作用。在前向传播中复制它们 — 权重相同,无需训练,无需合并 — 模型在特定能力上就会获得可测量的性能提升。

基于 David Ng 的 RYS 方法构建,并扩展了新发现。这里的所有内容都是在两块 AMD 消费级 GPU(RX 7900 XT + RX 6950 XT)上花一个晚上发现的。

Devstral-Small-2-24B:层 12、13、14 复制一次

我在 Vast.ai 的 H200 实例上运行了完整的测试,对比了 devstral 基础模型和手术修改后的模型,结果如下:手术确实在做一些真实且具体的事情:它提升了数学推理和因果推理,但代价是指令跟随和代码生成能力下降。模型思考更深入但按指示的精准度较低。

在 results 文件夹中你可以看到 eval_base 和 eval_surgery 下的结果。我还在仓库中添加了 vastai_rys_eval.sh,这是在 Vast.ai 中运行整个流程的脚本。Vast.ai 实例通过以下方式创建:

vastai create instance somenumberhere --image vastai/base-image:cuda-12.8.1-cudnn-devel-ubuntu22.04 --disk 80 --direct --ssh
=================================================================================
lm_eval Results Comparison
=================================================================================
Metric                                              base  rys_12_15 Δ(last-first)
---------------------------------------------------------------------------------
bbh/causal_judgement [exact_match]                0.5775     0.6364     +0.0588

bbh/date_understanding [exact_match]              0.9440     0.9000     -0.0440

bbh/logical_deduction_five_objects [exact_match]     0.7440     0.7320     -0.0120

bbh/navigate [exact_match]                        0.9600     0.9440     -0.0160

gsm8k_cot [flexible-extract]                      0.8650     0.8787     +0.0136
gsm8k_cot [strict-match]                          0.8408     0.8704     +0.0296

ifeval [inst_level_loose_acc]                     0.7446     0.7206     -0.0240
ifeval [inst_level_strict_acc]                    0.6990     0.6595     -0.0396
ifeval [prompt_level_loose_acc]                   0.6728     0.6488     -0.0240
ifeval [prompt_level_strict_acc]                  0.6229     0.5767     -0.0462

mbpp [pass_at_1]                                  0.7000     0.6700     -0.0300
=================================================================================

Average (all metrics)                             0.7610     0.7488     -0.0122

Qwen2.5-Coder-32B:层 7、8、9 复制一次

在定制探针套件上测量(BBH 衍生 + EQ-Bench 风格 + GSM8K):

推理电路原理

Transformer 在训练期间将自己组织成功能电路 — 执行完整认知操作的多层处理单元。这些电路是不可分割的:复制单个层几乎没有效果,但复制正确的 3-4 层块会给模型的推理管道一个第二遍。

不同模型在不同位置有不同的电路:

  • Devstral-24B(40 层):推理电路在层 12-14
  • Qwen2.5-32B(64 层):推理电路在层 7-9

边界很清晰。沿任一方向移动块一层,改进就会消失或反转。

"模式"发现

不同的复制模式从相同权重创建不同的认知配置:

相同的磁盘权重。基础模型相同的 VRAM。只是不同的路由。

在你的模型中查找电路

pip install gguf requests tqdm

python sweep.py \
    --model /path/to/model.gguf \
    --llama-server /path/to/llama-server \
    --tmpdir /dev/shm/rys \
    --results pass.jsonl \
    --block-sizes 3 4 5 \
    --stride 1 \
    --start-min 10 --start-max 20 \
    --skip-baseline \
    --port 8099 \
    --server-args --device Vulkan1,Vulkan2

应用已知电路

# Duplicate layers 12-14 in Devstral (the result validated above)
python layer_path.py model.gguf improved.gguf \
    -p "0..14,12,13,14,15..39" -v

# Duplicate layers 7-9 in Qwen2.5-32B
python layer_path.py model.gguf improved.gguf \
    -p "0..9,7,8,9,10..63" -v

# Go wild: triple-pass, interleaved, skip layers, whatever you want
python layer_path.py model.gguf experiment.gguf \
    -p "0..16,13,14,15,16,13,14,15,16,17..39" -v

使用已建立的基准进行验证

# Start the server with modified model
llama-server -m improved.gguf --port 8089 -ngl 99 --device Vulkan1,Vulkan2

# Run lm-evaluation-harness
lm_eval --model local-chat-completions \
    --model_args model=test,base_url=http://localhost:8089/v1/chat/completions,num_concurrent=1,max_retries=3,tokenized_requests=False \
    --tasks gsm8k_cot,ifeval,mbpp,bbh_cot_fewshot_logical_deduction_five_objects \
    --apply_chat_template --limit 50 \
    --output_path ./eval_results

# Compare runs
python compare_eval.py ./eval_base ./eval_improved

工作流程

对于每个层配置 (i, j):

  • GGUF 手术创建一个模型,其中层 i..j-1 被物理复制
  • 新的前向传播:层 0..j-1 → 层 i..j-1 再来一遍 → 层 j..N-1
  • llama-server 加载修改后的模型
  • 三个探针套件运行:数学、EQ、推理(BBH 衍生)
  • 将分数与基线进行比较,结果实时打印
  • 服务器关闭,修改后的 GGUF 删除,进行下一个配置

搜索策略

  • 第 1 遍:大块(8 层),宽步幅 → 找到热区
  • 第 2 遍:小块(3-5 层),步幅为 1,在热区内 → 找到精确边界
  • 第 3 遍:尝试多遍、交错和复合配置

修改后的 GGUF 被写入 tmpfs(/dev/shm)并在每次测试后删除。基础模型权重保留在磁盘上。

需求

  • 构建好 llama.cpp 的 Linux 系统(CPU、CUDA、Vulkan 或 Metal)
  • Python 3.10+ 与 gguf、requests、tqdm
  • 足够的 VRAM/RAM 来运行模型 + 一些额外的重复层

可选:用于基准验证的 lm-eval,用于热力图绘制的 matplotlib

常见问题

这会使用更多 VRAM 吗?

会的,重复的层在 GGUF 中是物理副本。对于 24B 模型的 3 个额外层,预计会增加约 1.5 GiB。llama.cpp 前向传播补丁(使用指针而不是副本)会消除这个问题 — 欢迎贡献。

这会减慢推理速度吗?

会的,与额外层数成比例。40 层模型上 3 个额外层 = 约 7.5% 更慢。推理改进值得这个代价。

这会在我的模型上工作吗?

可能会。我们在 Mistral 架构(Devstral)和 Qwen2 架构上进行了测试。Ng 的原始工作是在 Qwen2-72B 上进行的。电路存在于所有 transformer 模型中 — 问题只是它们在哪里以及有多大。运行扫描并找出来。

为什么不微调呢?

这与微调是正交的。你可以同时做两者。实际上,Ng 的 RYS 模型后来被其他人微调,并在 HuggingFace 排行榜上名列前茅。层复制改变了架构;微调改变了权重。堆叠它们。

致谢

  • David Ng 提出了 RYS 方法以及 transformer 具有功能性神经解剖的见解
  • llama.cpp 使本地推理成为可能
  • lm-evaluation-harness 进行基准验证
Original source

本文由 AI 翻译整理自 Hacker News · github.com,原文版权归原作者所有。

阅读英文原文
上一篇
Cursor Composer 2:前沿级AI编码能力升级
下一篇
Claude Code 在工程领域的实战应用