KernelHive

KERNELHIVE · DAILY TECHNICAL INTELLIGENCE

KernelHive AI Systems Daily

北京时间2026-09-30阅读数据加载中

论文

6 条

今日论文聚焦大模型推理的显存与算力效率:MoE 专家预取、KV 与循环状态低比特压缩协同降低服务成本,同时以神经排序和统一编译运行时推进算子调优与异构部署。

★★★★★arXiv

LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

混合线性注意力以固定 recurrent state 代替增长的 KV cache,但逐步低比特量化会让误差跨 token 累积,并受 outlier 行列影响。LeapQuant 在每个 token 窗口末端才量化状态,窗口内保留高精度更新,同时把最大 outlier 存为少量 Compensator Tokens 并平滑残差。Qwen、Kimi、GLM 实验显示 8-bit 接近 FP32;在 B200、RTX PRO 6000 和 RTX 5090 上,单层 kernel 最高加速 2.68、3.95 和 4.25 倍,端到端平均加速约 1.47 倍。

为何值得关注:为线性注意力 recurrent state 提供了兼顾精度、显存和 GPU 更新效率的窗口化量化方案。

★★★★★arXiv(Iowa State University、Clemson University、AMD、Argonne National Laboratory)

Accelerating Transfer-Learning-Based Autotuning with Predictive LLVM IR Performance Ranking

HPC 内核调优要在庞大配置空间中反复编译和运行,传统方法容易耗尽有限评估预算。论文提出 Neural Configuration Scorer (NCS):先由迁移学习的 GCTLA 过采样候选,再把候选 LLVM IR 输入五个按性能分位训练的 CNN,预测并排序近优配置,仅将高排名者降级为机器代码实测。在 3 个 Polybench/C kernel 与 3 个 ECP proxy 应用、8 张 NVIDIA A100 上,达到最优结果平均少用 27.85% 评估,最高减少 61.67%;SyR2K SM 的平均试验次数由 201.67 降到 16,训练推理和编译开销不超过约十次评估。结果集中于单一硬件和有限 benchmark,CNN 对长程 IR 依赖及部分应用的排序仍可能失准。

为何值得关注:用 LLVM IR 的机器学习排序减少 kernel autotuning 的实测次数,为有限预算下的自动算子优化提供了可复现实验路径。

★★★★☆arXiv

Mira: Memory-Efficient MoE Inference Using Adaptive Caching and Predictive Expert Staging

MoE 模型的专家参数常超过单 GPU 显存,而传统 offloading 要等 router 输出后才搬运,难以与计算重叠。Mira 用轻量预测器提前两层预测专家,结合由路由 telemetry 驱动的 HOT+STAGE 双层缓存,并以定制压缩格式降低传输开销。实验在 24GB 显存环境中较 MoE-Infinity 平均吞吐提升 5.71 倍,TTFT 提升 5.61 倍;在 48GB 环境中预取收益变小,说明方法主要适合显存紧张场景。

为何值得关注:通过预测预取和分层缓存隐藏 MoE 专家 I/O,为单 GPU 部署高容量模型提供了可量化的系统路径。

★★★★☆Apple

KV-Kaizen: Learning Context-Adaptive Cache Compression Choices

长上下文会让 KV cache 的容量和读取开销持续增长;统一量化或丢弃 token 可能损害后续回答。KV-Kaizen 在微调时学习一个按输入选择逐层配置的模块,组合跨层共享、低位精度与 MLA 低秩截断,并约束总缓存预算。论文在所测至少 7B 模型上报告约 4 倍压缩时任务准确率与未压缩对照相近。选择器只在 prefill 前运行一次,但方案需要模型共同微调;混合配置的实际提速仍需专门 kernel 验证。

为何值得关注:它把长上下文服务的缓存分配从统一规则变成受准确率和预算共同约束的逐层选择。

★★★★☆Institute of Science and Technology Austria / ETH Zürich

WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms

长上下文及批量推理会增加 KV cache 的容量和读取流量,但直接压到 2-bit 易放大 attention 误差。WUSH-KV 利用校准数据的二阶统计,为 key 与 value 分别构造数据自适应变换;value 变换可并入权重,key 变换仍需在线执行。论文将方案接入 SGLang,在 Qwen3-8B 的 AIME 2025 测试中得到 46.7%,高于同条件 OSCAR 的 34.4%。这些结果支持其质量表现,尚未证明在线变换后的吞吐收益。

为何值得关注:它为低比特推理缓存提供了模型质量证据,同时明确留下在线计算成本与吞吐验证问题。

★★★☆☆arXiv(麻省理工学院作者)

RLX: A Unified Multi-Backend Tensor Compiler and Distributed Runtime in Rust

生产环境常将图编译和 kernel 执行拆在不同层,算子可能隐式回退,跨设备部署时难以确认运行路径。RLX 用 Rust 实现统一的三级 中间表示、编译器与运行时;算子分派明确选择原生实现、通用 IR 或图改写,不可合法化则报错。论文在单台 Apple Silicon 主机上测试 all-MiniLM-L6-v2:batch 32 时 RLX-Metal 编码器前向 p50 为 16.6 毫秒,PyTorch-MPS 为 26.7 毫秒。该结果说明这一设置下的性能表现,不代表所有模型与后端均获益。

为何值得关注:显式的算子分派报告把跨后端性能优化落实到可定位的 kernel 路径,但性能结论仍须在目标模型和硬件上复测。

新闻

2 条

新闻侧呈现国产算子生态的跨平台扩展与 AI coding agent 的实测竞争:昇腾适配和工具链开放加速迁移,但单算子、有限芯片评测仍限制性能结论外推。

雷峰网

对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

文章把免费 AI Coding Agent AgnesCode 推入底层算子工程:针对 DeepSeek-V3 解码阶段的融合 QKV-A 下投影算子,在 FlagOS 赛题环境中自动读题、改代码、测试和迭代,并与 Codex+GPT-5.6 Sol 使用相同环境、接受 8 款芯片的官方评测。AgnesCode 用时 20 分 36 秒、通过 6 款芯片;双方共同通过的 5 款中有 4 项加速比更高,在一款国际芯片上达到 4.81×,但整体通过数低于 Codex 的 7 款。结果说明 AI 算子优化 已可形成可验收闭环,但证据仅覆盖单个算子、特定模型和赛事芯片,不能外推为通用能力。

为何值得关注:该实测展示了 AI agent 从生成应用代码进入多芯片 Kernel 优化 的工程闭环,并以官方自动化评测比较通过率和加速比;但样本只有一个 DeepSeek-V3 算子,仍需更多任务验证泛化性。

雷峰网

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!

针对大模型算子依赖 CUDA、迁移到昇腾需要重写底层代码的问题,雷峰网报道 TileLang 已支持华为昇腾 950,DeepGEMM、DeepEP、FlashMLA 等计算与通信库也推出昇腾版本。报道介绍,TileLang 基于 TVM,以分块编程和分离的目标后端处理不同芯片的指令生成,同时保留存储与流水线控制能力。文中引用的性能比较主要来自既有 H100 等平台测试,未提供这些算子在昇腾 950 上的完整对照基准;跨平台可用性不等于性能已经持平。

为何值得关注:昇腾后端与关键算子库的适配为迁移提供了工具链入口,但仍需在目标芯片和实际模型上验证正确性与性能。