DeepSeek DeepGEMM 详解:面向 LLM 推理的 FP8 精细化缩放矩阵乘核
深入解析 DeepGEMM 的 FP8 矩阵乘实现,聚焦细粒度缩放机制与 LLM 推理落地的关键参数。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
深入解析 DeepGEMM 的 FP8 矩阵乘实现,聚焦细粒度缩放机制与 LLM 推理落地的关键参数。
深入解析开源语音合成工作室 Voicebox 的 Web 端流式推理架构,涵盖 SSE/ WebSocket 传输层选型、音频帧缓冲调度算法与端到端延迟优化的工程参数。
深入解析 sfsym 如何通过私有 API 访问 CUINamedVectorGlyph,构建从 macOS 符号渲染器到 SVG/PDF/PNG 的完整导出管道,并给出四种渲染模式的参数映射。
从偏序集的范畴论视角出发,探讨子类型约束、类型系统与并发原语中的偏序结构,并给出工程实践参数。
探讨以挪威尼诺斯克方言为基础的编程语言设计,涵盖静态类型系统架构与JVM字节码生成的关键技术路径。
深入分析 HTTP URL 路径中连续双斜杠规范化的安全风险,揭示路径语义分裂与安全检查绕过的根本原因,并给出可落地的工程参数与监控要点。
深入解析在动态链接器加载阶段对 ELF 二进制进行重写的技术方案,通过 PLT/GOT 注入与链接器行为干预实现系统调用拦截的工程参数与监控要点。
深入解析构建 GLSL 着色器编辑器的核心工程模式:热重载策略、编译错误捕获、可视化调试与生产环境部署要点。
基于 METR 基准数据,解析 AI 代理单次推理成本与任务时长的关联机制,量化 token 消耗、模型复杂度与单位成本的变化曲线。
基于 METR 基准数据,解析 AI 代理单次推理成本与任务时长的关联机制,量化 token 消耗、模型复杂度与单位成本的变化曲线。
深入解析 Emacs 包管理器的信任模型,涵盖 GPG 签名验证机制、可重现构建工具链与安全策略配置要点。
深入解析 OpenAI Agents SDK 的核心架构设计,从原语抽象到多智能体编排模式,提供工程落地的关键参数与最佳实践。
分析四大云厂商年度资本支出与曼哈顿计划、阿波罗登月等美国历史性超级工程的对比,揭示AI基础设施投资的规模已远超政府主导的标志性项目。
详解基于 WebGL 的浏览器端 GLSL shader 编辑器核心架构,提供实时预览管道、Uniforms 管理与编译错误处理等工程化参数与最佳实践。
解析 Superpowers 如何通过结构化技能系统与多 AI 编码工具深度集成,实现可复用的开发方法论与自动化工作流编排。
深入分析 AI 智能体基础设施成本结构,解析计算资源消耗真相与硬件架构演进如何重塑 TCO。
通过裁剪Linux内核冗余模块与优化启动链路,实现微VM亚秒级冷启动的工程化实践与关键参数。
深入解析NASA Force工程人才招聘计划的架构设计、岗位方向及其对航空结构分析领域的影响。
深入解析NASA NASTRAN结构分析系统的架构设计与航空工程仿真应用,涵盖有限元分析求解器、典型工作流及工程实践参数。
深入解析Fil-C内存安全实现的核心机制,为编译器优化与安全系统设计提供可落地的工程参数。