Flora Ma
Hi,我是 Flora,软件工程师,瑜伽与冥想爱好者(曾赴印度学习)。这里记录我在技术上的学习和探索。
Recent posts
- 大语言模型接口协议
本文对比介绍了 Anthropic Messages API、OpenAI Chat Completions API 和 OpenAI Responses API 三种主流的大语言模型接口协议,并探讨了在考虑到 KV cache 复用的情况下如何更好的使用协议
- 对 asyncio 更详细的介绍
本文介绍了 asyncio 的基本使用以及背后的事件循环和调度机制,总结了协程之间的同步机制,并介绍了协程的常用场景,对于计算密集型的 python 任务可以通过 loop.run_in_executor 丢到进程池中
- 大语言模型推理和训练显存估算
本文以 Qwen3-8B 为例,我们对其推理/训练占用的显存进行了分类和估算,可依据此来筛选可用的 GPU 机器
- Triton 学习笔记
本文介绍了如何编写 Triton 算子,列出了 Triton 的关键语法,然后介绍了 Triton 算子的优化流程,包括如何判断算子的正确性、如何准确测量性能以及如何识别瓶颈也优化。
- CUDA 编程模型与内存层次:一份学习笔记
本文先介绍了 GPU 的硬件模型,详细介绍了 SM,然后介绍了 CUDA 的编程模型(thread、warp、block、cluster、grid)以及编程模型是如何在硬件模型上运行的,接着介绍了 GPU 的内存层次,以及编程模型是如何使用这些内存的,最后探讨了下 warp 和 tensor core 的一些问题。