从零实现 Transformer LLM:PyTorch 自定义分词、多头注意力与生成式训练循环
基于 PyTorch 从零构建 Transformer LLM,涵盖自定义分词、多头注意力及生成训练循环,提供工程参数与最佳实践。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
基于 PyTorch 从零构建 Transformer LLM,涵盖自定义分词、多头注意力及生成训练循环,提供工程参数与最佳实践。
基于 SV2TTS 架构,在交互式应用中实现 sub-200ms 延迟语音克隆,提供 encoder 合成优化参数、WebRTC 集成指南及监控要点。
利用 egglog 的 e-graphs 技术,支持动态表达式重写和优化,适用于编译器 IR 变换与数据库查询重构。
利用变长模板和 SFINAE 构建一个紧凑的类型安全字符串格式化器,通过操作符重载实现无缝集成,仅需 65 行代码。
探讨浏览器 MMO 如 Blobeer 的实时多人游戏工程,聚焦 WebSockets 同步、机器人 AI 行为、Boss 战斗动态和道具系统。包含状态管理和延迟处理的实用参数。
探讨如何利用 Triton 在 CUDA 上优化生命游戏,通过融合邻居计数和更新内核,利用 warp 级并行和共享内存平铺在大网格上实现 10 倍加速。
通过提取和反汇编 AMD Turin PSP 固件二进制文件,识别 CoreBoot 集成的关键钩子,实现专有 blob 最小化。
在ARMv8-A系统上探讨Apple M1内存排序语义,优化并发代码的屏障放置与Litmus测试验证。
在ARMv8-A系统上探讨Apple M1内存排序语义,优化并发代码的屏障放置与Litmus测试验证。
探讨浏览器如何利用 OCSP Stapling 实现高效的证书撤销验证,减少延迟和隐私风险,包括验证参数和监控要点。
通过 Docker CLI 插件构建 MCP 网关,实现跨 AWS、GCP 和 Azure 的容器统一部署、扩展和监控,提供工程化参数与最佳实践。
针对自由职业者,介绍如何用 TypeScript 和 Supabase 集成 AI 实现自动化发票处理、时间追踪和文件对账的后台系统。
A hands-on guide to implementing key OS components in Rust for x86 bare-metal, including bootloader setup, paging, simple scheduling, and interrupts with GDB support.
介绍如何在 Observable 笔记本中创建自定义数据加载器,支持异步数据获取、内存在缓存和响应式更新,实现无需页面重载的实时数据探索。
利用 C++ 模板元编程实现 FakeIt 框架,探讨自动方法拦截与验证机制,提供单元测试中的工程化参数与最佳实践。
基于 SV2TTS 框架,探讨 GE2E 编码器在实时语音克隆中的应用,提供 Tacotron2 合成和 WaveRNN 声码器的工程化参数与多说话人适配策略。
通过 ReVanced 的模块化框架,利用 Smali 注入和运行时钩子实现 Android 字节码修补,支持无根应用的广告阻挡与自定义功能。
基于LLM的多代理系统在模拟对冲基金中的应用,涵盖市场分析、风险建模、投资组合再平衡及回测策略。
基于 OpenCode 在终端中实现 AI 编码代理,支持异步代码生成、Shell 集成和批处理 CLI 工作流,提供工程化参数和监控要点。
针对现代排序算法如Timsort,探讨缓存友好的自适应分区和galloping模式优化,提供工程参数设置与性能监控要点,实现真实数据集下的显著性能提升。