使用 FlashAttention 内核实现最先进的线性注意力:长序列 Transformer 的 O(n) 缩放
面向长序列 Transformer,给出 Flash Linear Attention 的高效实现、训练参数和推理优化要点,支持超过 1M tokens 的序列处理。
Latest Essays
继续沿着时间线阅读近期的工程实践与技术观察。
近期的思考与工程笔记。
面向长序列 Transformer,给出 Flash Linear Attention 的高效实现、训练参数和推理优化要点,支持超过 1M tokens 的序列处理。
面向亿级向量数据库,给出 Milvus 云原生分片、混合 HNSW/IVF 索引、实时数据摄入以及容错复制的工程化参数与监控要点。
通过 ISA 抽象层和统一引导加载器,SkiftOS 实现多架构内核支持,提供内存、中断和驱动的工程化参数与实现清单。
在 K2-Think 框架中集成适配器-based PEFT 模块,通过低秩适配和任务特定路由优化 LLM 推理,提供工程参数和监控要点。
基于 Flash Linear Attention 库,探讨优化内核在 Transformer 长序列处理中的应用,提供安装与配置指南。
基于 Flash Linear Attention 库,探讨如何在 GPU 上实现 O(n) 复杂度线性注意力机制,支持多种 SOTA 模型的快速训练和推理。
探讨 Java 25 中低开销 CPU 分析,利用 JFR 集成和火焰图可视化高效分析多线程应用瓶颈。
基于Triton优化的Flash Linear Attention内核,帮助Transformer处理长序列,降低内存开销,提供安装与调优指南。
基于浏览器实现 Plan 9 风格的 Web OS,利用虚拟命名空间和联合文件系统,支持无服务器状态的分布式应用托管。
面向 ARM、x86 和 RISC-V,SkiftOS 的多架构引导加载器设计,涵盖统一引导、硬件抽象和错误恢复序列的工程实践。
探讨如何在Aris AI中使用过滤LLM、互动测验和家长控制来生成安全、适应性的响应,确保儿童教育无害且引人入胜。
基于 EPFL 机器学习课程实验,探讨 PyTorch DDP 的数据并行、多 GPU 同步和容错梯度聚合的最佳实践与工程参数。
使用Claude子代理实现任务分解和并发执行,以优化复杂代码开发工作流的管理与共享状态。
探讨 UTF-8 的可变长度编码设计及其在字符串处理管道中的实现,提供国际化支持和错误恢复解析的实用参数与清单。
通过 device-mapper 的 dm-cache 在 NFS 等网络文件系统中引入 SSD 缓存,分析缓存一致性维护、预取策略及带宽降低的工程参数与实践。
通过 Chatbox 集成 Ollama 等本地 LLM,实现跨平台离线 AI 聊天,支持多模型切换与 UI 优化。
Using Genkit to integrate various AI models and platforms, leveraging code-centric patterns and built-in observability for scalable development.
探讨Kefir编译器如何通过solo开发实现C17/C23标准合规,包括AST解析、广泛验证套件以及生成可移植二进制文件的代码生成策略。
利用 Kyverno 的 CRD 机制,通过 validate、mutate 和 generate 规则实现资源变异、配置验证以及无代理动态网络策略生成,确保 Kubernetes 集群安全合规。
探讨 Vectroid 如何使用紧凑结构在 48MB 内索引 1B 向量,实现资源受限 AI 系统的快速 ANN 搜索。