跳到主要内容
Project /

把一个开源推理引擎移植到国产加速卡上,并用手写算子替换厂商库在关键路径上的实现。难点不在训练侧——模型要先在目标平台上完成精度转换和布局重排,这一步比微调麻烦得多,做不干净后面算出来全是 inf 和 NaN,再怎么优化都是错的。方法上守三条:每个算子都和参考实现做数值对拍;A/B 必须跑在同一个二进制、同一套测量装置下;基准盯绝对耗时,不盯比值——底下那层太慢会把上层的改进整个淹掉。具体成果受保密约束,不展开。

项目:
国产加速卡上的推理引擎移植
方向:
推理优化 / 算子开发
周期:
进行中
技术栈:
C / C++ · 手写算子
国产加速卡上的推理引擎移植 图 1
国产加速卡上的推理引擎移植 图 2
国产加速卡上的推理引擎移植 图 3
国产加速卡上的推理引擎移植 图 4
© 更多项目
继续看
© 常见问题
答疑

Straight Answers on Stack, Scope and 納期. 技术栈、边界和周期,先说清楚再开工。

© 结尾
收束

Independent

Systems

Traceable

Hands-on

不做包装过的能力清单。写出来的东西都在自己的机器上跑过、出过问题、改过,才敢拿出来讲。技术的价值在于能落到真实的业务里,而不是停在演示视频。

©2026