实现内存打包与动态张量重塑以实现全GPU利用率
通过内存打包和动态张量重塑优化大型模型预训练,消除闲置GPU周期,实现>95%利用率,无需硬件修改。聚焦Stanford低级分配技术,提供工程参数和监控要点。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
通过内存打包和动态张量重塑优化大型模型预训练,消除闲置GPU周期,实现>95%利用率,无需硬件修改。聚焦Stanford低级分配技术,提供工程参数和监控要点。
探讨 OpenTSLM 构建实时 IoT 异常检测流式推理管道,强调低延迟 token 流式、自适应 KV 缓存管理和边缘部署优化。
探讨如何在中文金融交易中使用多代理 LLM 框架,实现角色分工、实时数据馈送、多跳决策及合规回测,提供工程参数与清单。
针对欧盟网络弹性法案(CRA),开源项目需构建自动化 SBOM 生成、漏洞扫描及报告管道,提供可操作的参数配置与监控策略。
Sim 平台以 TypeScript 为基石,提供低代码工具快速构建多代理工作流,支持实时协作和自托管部署。本文聚焦工程实践,给出组成、执行和优化的可操作参数。
探讨 Hyperswitch 中使用 Rust 实现模块化异步连接器和确定性状态机,支持高吞吐量支付路由、零停机故障转移与连接器分片的关键工程实践。
探讨 Hyperswitch 中 Rust 异步连接器的模块化设计,通过状态机实现支付路由的幂等性、对账和低延迟 failover 工程实践。
在大型AI训练中,通过流水线并行和自适应批处理结合动态调度,实现95%+ GPU效率的工程参数与优化策略。
探讨 Edge264 解码器在 WebRTC 管道中的集成,焦点自适应抖动缓冲和帧同步策略,以实现实时视频应用的低延迟。
基于 Handy 项目,探讨 Silero VAD 的噪声鲁棒声活动检测、Whisper 的离线转录集成,以及 cpal 实时低延迟音频优化的工程参数与实现要点。
面向 LLM 管道,给出 Pathway 的流式 ETL 实现、RAG 实时更新参数与监控要点。
Tunix 作为 JAX 原生 LLM 后训练库,支持 RLHF 对齐和知识蒸馏,利用 TPU 实现高效优化。本文提供构建管道的实用指南,包括参数配置和监控策略,避免 PyTorch 开销。
Design multi-hop agent pipelines to replace RAG for complex queries, leveraging expanded context windows for direct reasoning over full documents without chunked retrieval overhead.
基于 Claude Agent SDK,探讨多代理协调机制,包括任务分解、并行工具调用与冲突解决,提供工程参数和监控要点,实现复杂工作流的高效落地。
探讨在 Motorola 68000 上通过纯 C 代码实现循环优化的工程方法,包括强度降低、循环展开和寻址模式选择,以最大化指令吞吐量。提供可落地参数和监控要点。
介绍构建合成数据管道和增强策略,用于微调 Pix2Tex ViT 模型以支持手写数学方程识别,包含可落地参数和监控要点。
集成 ViT OCR 与布局解析器,处理复杂文档多公式块的提取与 LaTeX 转换,提供 beam search 和符号校正工程参数。
探讨在AI短视频生成中,使用LLM指导音素到视素映射结合扩散模型实现真实唇同步的技术要点与参数配置。
探讨 Immich v2.0.0 稳定版的工程升级,包括自动化数据库模式迁移、ML 模型兼容性检查和 API 版本化,实现无停机自托管照片库过渡。
探讨 AI_NovelGenerator 如何通过多代理协作管理情节发展、解决伏笔并维持章节间角色一致性,利用专用代理角色和共享内存机制。