Project /
把一个开源推理引擎移植到国产加速卡上,并用手写算子替换厂商库在关键路径上的实现。难点不在训练侧——模型要先在目标平台上完成精度转换和布局重排,这一步比微调麻烦得多,做不干净后面算出来全是 inf 和 NaN,再怎么优化都是错的。方法上守三条:每个算子都和参考实现做数值对拍;A/B 必须跑在同一个二进制、同一套测量装置下;基准盯绝对耗时,不盯比值——底下那层太慢会把上层的改进整个淹掉。具体成果受保密约束,不展开。
- 项目:
- 国产加速卡上的推理引擎移植
- 方向:
- 推理优化 / 算子开发
- 周期:
- 进行中
- 技术栈:
- C / C++ · 手写算子










