CUDA-L2:使用 RL 自动调优 GEMM 内核实现高 L2 驻留超越 cuBLAS
详解 RL 在 GEMM 内核 autotune 中的应用,聚焦超参数扫瞄、奖励设计、tile 大小与异步拷贝参数,实现 A100/H100 上高性能与 L2 缓存驻留优化。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
详解 RL 在 GEMM 内核 autotune 中的应用,聚焦超参数扫瞄、奖励设计、tile 大小与异步拷贝参数,实现 A100/H100 上高性能与 L2 缓存驻留优化。
基于 wshobson/agents 的 63 插件与 85 代理,实现 Claude Code 智能终端自动化与多代理代码工作流,详解粒度设计、安装参数与协调清单。
Django 6 增强异步查询集支持 prefetch_related,实现高并发视图非阻塞 I/O,显著减少 DB 往返。提供基准阈值、参数配置与迁移清单。
针对 Android 碎片化到 TV 硬件加速,Netflix AV1 解码集成提供 fallback 梯度、SoC 性能回归测试及比特率自适应参数,确保无缝播放。
Tacopy 通过 AST 变换将尾递归函数转换为高效迭代循环,避免栈溢出并带来 1.41x-2.88x 性能提升,提供装饰器用法、验证与工程参数。
通过RL搜索warp TMA async copy参数与tile切分策略,实现H100上L2驻留GEMM超越cuBLAS的工程参数与监控要点。
基于Multivox项目,详解旋转LED面板的同步机制,使用光电二极管位置反馈与RPi实时驱动,实现高刷新率无鬼影3D体积POV显示的关键参数与工程实践。
PGlite 结合 pgvector 在浏览器中实现客户端向量索引与相似搜索,支持低延迟本地 RAG。提供完整参数配置、索引优化与监控清单。
剖析 PGlite WASM Postgres 运行时的核心嵌入机制、Postgres 线协议兼容、动态扩展加载与零配置持久化工程参数。
借鉴 Sourcegraph Zoekt,构建 trigram 索引,支持跨仓库低内存高召回的模糊代码搜索,提供工程参数与部署清单。
从NeurIPS 2025获奖论文中提取AI系统工程实践:注意力门控的sigmoid参数配置、1024层RL网络batch缩放、扩散隐式正则化阈值等落地要点。
通过亲和性规则、污点/容忍机制及拓扑分布约束,实现Pod在多节点间的均衡调度与高效卷绑定,提升资源利用率。
Bun单一二进制覆盖全JS工具链,性能基准超Node数倍,提供工程化参数、监控点与部署清单。
基于 OpenAI Codex 的 Rust 终端单代理,详述 LLM API 集成、本地工具执行与 CLI 持久化状态的最佳实践与工程参数。
纯CSS内联条件判断,支持style/media/supports查询,实现动态样式值,提供参数阈值、示例清单与兼容回退策略。
Hopper 架构下,利用 Warp-specialized 内核与 TMA 异步拷贝实现 L2 缓存驻留 GEMM 预加载,通过 RL 调优参数超越 cuBLAS 性能的关键工程实践。
基于 OnlyRecipe 的 4 年 HN 反馈迭代,详解网页食谱的启发式解析规则、DOM 清理清单、图片生成参数及 PDF/JSON 导出优化,提供生产级落地参数。
从NeurIPS 2025最佳论文提取可落地insights:门控注意力优化LLM训练稳定性,千层网络提升自监督RL效率,提供PyTorch集成代码、超参阈值、perf基准与监控清单。
借鉴MIT超声水采集技术,详述网格振动频率、振幅调谐、压电驱动与排水系统参数,实现雾滴快速聚并脱落与10倍大气水产出。
Zig 驱动的 Bun 运行时内置 bundler、test runner 和 pkg mgr,实现比 Node 工具链更快、更简洁的开发测试打包一体化参数与优化实践。