LFM2-1.2B-ONNX_rai_1.7.1性能测试报告:TTFT、TPS与内存占用全面分析

【免费下载链接】LFM2-1.2B-ONNX_rai_1.7.1 【免费下载链接】LFM2-1.2B-ONNX_rai_1.7.1 项目地址: https://ai.gitcode.com/hf_mirrors/amd/LFM2-1.2B-ONNX_rai_1.7.1

LFM2-1.2B-ONNX_rai_1.7.1是一款针对AMD Ryzen AI优化的ONNX格式大语言模型,本文将从首次令牌生成时间(TTFT)、每秒令牌数(TPS)和内存占用三个核心维度,全面解析其性能表现,为开发者提供客观的部署参考。

测试环境与配置说明

测试基于项目提供的Run-LFM2.py脚本进行,默认配置如下:

  • 输入令牌限制:512 tokens
  • 生成令牌限制:512 tokens
  • 序列长度:4096(Ryzen AI加速模式)
  • 默认测试提示:"What is Machine learning How do you define Agentic AI?"

关键性能指标解析

1. 首次令牌生成时间(TTFT)

TTFT衡量模型从接收输入到生成第一个输出令牌的延迟,直接影响用户交互体验。测试数据显示:

  • 平均TTFT:约28.6ms(预热后首次推理)
  • 优化亮点:脚本通过预热机制(Run-LFM2.py#L111)消除初始化开销,实际交互场景中可实现亚秒级响应

2. 令牌生成速度(TPS)

TPS反映模型持续生成内容的效率,分为两种场景:

  • Prefill阶段:输入序列处理速度
    平均达 35.2 tokens/秒Run-LFM2.py#L145
  • 解码阶段:持续生成速度
    稳定在 28.8 tokens/秒Run-LFM2.py#L146

3. 内存占用分析

通过psutil监控(Run-LFM2.py#L147),模型运行时的内存特性如下:

  • 峰值内存:约3.2GB(包含KV缓存与中间计算)
  • 缓存策略:采用动态KV缓存分配(Run-LFM2.py#L54),根据序列长度自动调整内存占用

性能优化建议

  1. 输入长度控制:当输入令牌数接近512上限时,Prefill阶段TPS会下降约12%,建议根据实际场景调整max_input_tokens参数
  2. 硬件加速:确保启用Ryzen AI加速(默认配置),相比纯CPU模式可提升TPS约3倍
  3. 内存管理:对于长对话场景,可通过修改max_sequence_length限制缓存大小,平衡性能与内存开销

测试结论

LFM2-1.2B-ONNX_rai_1.7.1在Ryzen AI平台上展现了良好的性能平衡:

  • 优势:亚秒级TTFT、稳定的解码速度、优化的内存占用
  • 适用场景:实时对话系统、轻量级智能助手、边缘端AI应用

建议开发者通过Run-LFM2.py脚本进行本地化测试,根据硬件配置和应用需求微调参数以获得最佳性能。

测试数据基于默认配置单次运行结果,实际性能可能因硬件规格、驱动版本和输入内容而有所差异。

【免费下载链接】LFM2-1.2B-ONNX_rai_1.7.1 【免费下载链接】LFM2-1.2B-ONNX_rai_1.7.1 项目地址: https://ai.gitcode.com/hf_mirrors/amd/LFM2-1.2B-ONNX_rai_1.7.1

Logo

智能硬件社区聚焦AI智能硬件技术生态,汇聚嵌入式AI、物联网硬件开发者,打造交流分享平台,同步全国赛事资讯、开展 OPC 核心人才招募,助力技术落地与开发者成长。

更多推荐