移除GPU后的AI数据中心:纯CPU推理架构的成本模型与性能边界
探讨纯CPU AI推理的性能特征、成本模型与适用边界,为数据中心架构决策提供可落地的参数清单与TCO对比框架。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
探讨纯CPU AI推理的性能特征、成本模型与适用边界,为数据中心架构决策提供可落地的参数清单与TCO对比框架。
探索 BurntSushi 的 Biff 工具如何通过自然语言解析、DST 感知计算和创新的 Tagging 系统,重新定义命令行时间数据处理的工程实践。
量化分析 Lua 解释器与 JIT 运行时的能效特征,提供从内存管理到 CPU 调度的绿色计算优化参数与可落地策略。
解析 Heretic 如何通过方向消融与贝叶斯优化实现全自动审查移除,在 Gemma-3-12B 上实现 KL 散度 0.16、拒绝率 3% 的工程实践。
从 Hallucinate 项目切入,剖析浏览器端大规模多人在线实时同步的传输层选择、服务器权威模型与客户端预测机制,给出可落地的 tick 频率、延迟预算与监控要点。
构建可处理20年跨平台IM数据的ETL流水线,涵盖多源数据提取、标准化转换、隐私脱敏与时序情感分析的技术方案与参数清单。
解析Qwen3.7-Max如何在无芯片架构文档的情况下,通过KV缓存分区、内存管理优化和线程级重构实现10倍推理加速。
探索 Understand-Anything 的多智能体管道设计,以及如何通过确定性解析与语义理解的混合架构,实现代码库的交互式可视化和渐进式学习。
把团队休息日视为技术债务预防机制,通过缺陷密度、返工率、PR响应时间等可量化指标,建立休息与代码质量之间的因果关系模型。
将人类工作流抽象为排队系统,运用 Little's Law 与瓶颈分析,给出可落地的 WIP 限制计算与流程优化参数。
解析8位机时代10 PRINT迷宫生成器的技术原理,探讨极简算法如何启发现代程序化内容生成,并提供可落地的地牢生成参数清单。
探讨LLM推理阶段的周期性冷却机制,通过动态负载调度与KV缓存状态重置防止连续推理导致的校准漂移与输出质量衰减,提供可落地的工程参数与监控策略。
从 shared memory bank conflict 消除切入,剖析可预测数据模式下 warp 级调度与线程块 tile 布局的协同优化策略,提供可落地的参数配置与验证方法。
探讨代码知识图谱构建中同名函数与重载方法的实体消歧技术,结合调用上下文、类型推断与图结构嵌入实现精准符号解析。
解析 WSL2 与 Windows 剪贴板互操作的技术障碍,对比 OSC 52/1337 协议能力边界,并提供基于 PowerShell 桥接与 Claude Code Hooks 的完整工程化解决方案。
解析SCCS weave数据结构的指令编码、行池去重与激活集位图表示,给出版本控制场景下delta存储的工程化参数与性能权衡。
探讨 Typst 作为 LaTeX 替代在现代文档流水线中的工程实践,包括模板变量注入机制、样式隔离策略与跨格式编译一致性保障。
以2026年5月27日GitHub多服务故障为例,剖析分布式代码托管平台跨服务中断的典型根因模式、定位方法与可落地的恢复策略参数。
解析Google FCM与Apple APNs的速率限制机制、配额申请流程及内容合规策略,提供可落地的连接池设计与监控方案。
对比分析三种主流去中心化 Mesh 网络协议的路由算法、网络架构与离线通信能力,为不同规模部署提供选型参考。