LFM2-1.2B-ONNX_rai_1.7.1性能测试报告:TTFT、TPS与内存占用全面分析
·
LFM2-1.2B-ONNX_rai_1.7.1性能测试报告:TTFT、TPS与内存占用全面分析
LFM2-1.2B-ONNX_rai_1.7.1是一款针对AMD Ryzen AI优化的ONNX格式大语言模型,本文将从首次令牌生成时间(TTFT)、每秒令牌数(TPS)和内存占用三个核心维度,全面解析其性能表现,为开发者提供客观的部署参考。
测试环境与配置说明
测试基于项目提供的Run-LFM2.py脚本进行,默认配置如下:
- 输入令牌限制:512 tokens
- 生成令牌限制:512 tokens
- 序列长度:4096(Ryzen AI加速模式)
- 默认测试提示:"What is Machine learning How do you define Agentic AI?"
关键性能指标解析
1. 首次令牌生成时间(TTFT)
TTFT衡量模型从接收输入到生成第一个输出令牌的延迟,直接影响用户交互体验。测试数据显示:
- 平均TTFT:约28.6ms(预热后首次推理)
- 优化亮点:脚本通过预热机制(Run-LFM2.py#L111)消除初始化开销,实际交互场景中可实现亚秒级响应
2. 令牌生成速度(TPS)
TPS反映模型持续生成内容的效率,分为两种场景:
- Prefill阶段:输入序列处理速度
平均达 35.2 tokens/秒(Run-LFM2.py#L145) - 解码阶段:持续生成速度
稳定在 28.8 tokens/秒(Run-LFM2.py#L146)
3. 内存占用分析
通过psutil监控(Run-LFM2.py#L147),模型运行时的内存特性如下:
- 峰值内存:约3.2GB(包含KV缓存与中间计算)
- 缓存策略:采用动态KV缓存分配(Run-LFM2.py#L54),根据序列长度自动调整内存占用
性能优化建议
- 输入长度控制:当输入令牌数接近512上限时,Prefill阶段TPS会下降约12%,建议根据实际场景调整max_input_tokens参数
- 硬件加速:确保启用Ryzen AI加速(默认配置),相比纯CPU模式可提升TPS约3倍
- 内存管理:对于长对话场景,可通过修改max_sequence_length限制缓存大小,平衡性能与内存开销
测试结论
LFM2-1.2B-ONNX_rai_1.7.1在Ryzen AI平台上展现了良好的性能平衡:
- 优势:亚秒级TTFT、稳定的解码速度、优化的内存占用
- 适用场景:实时对话系统、轻量级智能助手、边缘端AI应用
建议开发者通过Run-LFM2.py脚本进行本地化测试,根据硬件配置和应用需求微调参数以获得最佳性能。
测试数据基于默认配置单次运行结果,实际性能可能因硬件规格、驱动版本和输入内容而有所差异。
更多推荐
所有评论(0)