TPU脉动阵列对比GPU张量核:HBM效率与Google长期AI训练路径
对比TPU systolic array与GPU tensor cores在HBM带宽与功率效率的优势,剖析Google长期AI训练的工程参数与扩展策略。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
对比TPU systolic array与GPU tensor cores在HBM带宽与功率效率的优势,剖析Google长期AI训练的工程参数与扩展策略。
剖析 TPU 脉动阵列在稠密矩阵乘法中的 HBM 带宽利用与能效优势,对比 GPU 张量核在动态负载下的灵活性与长期训练热功耗挑战,提供集群参数与监控清单。
剖析 ChinaTextbook 项目用单一 Git + LFS 分发超 40GB PDF 教材的技术细节,包括 delta 克隆优化、全球镜像加速及落地参数,避免 HTTP 分发瓶颈。
Go 代码优先的零依赖 AI 代理运行时,实现 shimless 工具调用与并发 context 缓存,支持多代理低延迟协调的参数配置。
利用 n8n 可视化节点图构建生产级代理式 AI 流水线,详解 LLM 链式调用、API 编排、条件分支、重试机制及凭证隔离的最佳参数与监控要点。
工程化LM辅助编码实践:平衡本质复杂性(形式正确性验证)与事故复杂性(实用迭代部署、错误容忍),提供工具链集成、参数配置与监控框架。
LightRAG 通过双图索引、查询融合与 chunk 参数优化,实现低资源高效 RAG,结合蒸馏技术超越稠密检索基线。
面向AI模型训练与蒸馏链路,给出GPL许可证传播检测的token注入追踪、合规模型过滤及自动化审计管道的具体工程参数与监控要点。
针对 GPL copyleft 在 AI 模型训练中的传播不确定性,提出通过训练时特殊令牌注入嵌入可验证许可元数据的技术方案,实现蒸馏传播检查与合规审计机制。
详解 nvm 在 POSIX 环境下通过 shim 机制实现并发 Node 版本安装与切换的无竞态设计,包括符号链接隔离、共享缓存参数与监控要点。
针对 AI 代理设计核心痛点,提供规划循环、工具调用及状态管理的工程参数、阈值与监控清单,实现生产级可靠性。
reverser.dev启发的内核struct交互工具,提供布局可视化、指针追逐、搜索,提升逆向工程工作流。详解机制、参数清单与监控要点。
基于Penpot的SVG设计场景,解析CRDT在多用户实时形状编辑、层级管理和原型交互中的工程参数与落地清单,确保零冲突同步与代码导出。
利用 Microsoft Call Center AI 的 /call API 派遣 AI agent 主动拨出电话,支持 GPT-4o-mini 流式语音、RAG 检索、中断感知工具调用,实现呼叫中心 outbound 自动化。
形式化宏汇编器中间表示(IR)语义,实现扩展/收缩过程验证,证明双向等价,并提取OCaml检查器,提供卫生宏处理的工程参数。
基于Fara-7B的LoRA微调方案,实现屏幕截图解析、动作预测与执行的工程化优化,提供参数配置、训练清单与低延迟推理要点。
剖析Tracy profiler中lock-free ring buffer的设计,用于多线程低开销采样,支持user zones和并发捕获,提供工程参数与监控要点。
VERL框架下,利用FSDP实现多GPU数据并行KL-PPO,支持离线RLHF偏好排名蒸馏。详解配置参数、3D-HybridEngine优化与监控要点,确保高效训练大模型对齐。
面向血管计算原则的形式化,给出HOL证明器中宏展开验证与计算模型的类型定义、重写规则与证明策略清单。
LightRAG 通过实体-关系双图与 hybrid 查询融合,实现低资源 RAG 的 chunk 阈值优化、边提炼与快速检索参数。