更多精彩,请点击上方蓝字关注RVEI
自2026年9月8日起,两周时间,19款软件,101项复核有效RISC-V开源补丁!
中国科学院软件研究所智能软件研究中心研究团队开发并运用“源生智能体”,完成了一轮覆盖系统基础库、语言运行时、计算框架、多媒体和数据库服务的软件优化实践。
团队内三位学生许佳凯、王红岩和张瑾涵推进从测试数据到开源候选补丁生成,开源软件专家对形成的534项候选补丁开展代码审查,最终复核归档101项优化补丁,其中99项附有量化性能提升记录,另2项属于功能性补丁。
0
1
源生智能体:三层Harness架构连接知识与执行
ISA领域知识层、多智能体协同层、工作流与运行层,三个层次共同构成源生智能体的Harness架构,如图1所示。这里的Harness,是围绕智能体建立的工程支撑体系,它将专业知识、角色分工、工具调用和执行管理结合起来,承载从诊断到补丁验证的全过程。
-
ISA领域知识层
汇集ISA优化技能、多方证据七阶段诊断、代码规范与架构知识。
-
多智能体协同层
Trace智能体诊断根因,Craft智能体生成候选补丁,CI智能体执行测试验证。
-
工作流与运行层
以数据契约、隔离调度、状态管理和测试工具支撑执行。
图1 源生智能体三层Harness架构
0
2
ISA领域知识层:面向RISC-V构建可复用的优化技能体系
如何将处理器架构知识转化为智能体可以调用的技能,正在成为软件性能优化的重要探索方向。
Intel的intel-performance-skills围绕Intel平台,将性能分析、代码优化模式与基准测试组织为可复用技能;Arm的sme-executorch-profiling、arm-enablement、arm-performix技能依托性能分析工具,强调通过测量定位热点、解释瓶颈,并验证修改前后的效果,如表1所示。
源生则立足RISC-V开源软件生态,将领域知识融入面向开源软件的优化技能体系,突出跨软件栈的知识复用与工程协同。
表1 Intel与Arm的官方支持技能集
|
来源 |
技能集 |
功能定位 |
|
Intel 官方 GitHub |
intel-performance-skills |
面向Intel x86 Linux CPU,串联性能采样、瓶颈分析、代码优化和基准测试 |
|
Arm 官方开发者生态 GitHub |
sme-executorch-profiling |
覆盖环境准备、构建、模型导出、性能采集、分析、验证和报告,重点是 ExecuTorch 的 SME2 推理加速 |
|
Arm 官方 GitHub |
arm/mcp 中的 arm-enablement |
侧重 Arm 迁移、兼容性检查、构建测试和工具接入 |
|
Arm 官方介绍的补充项目 |
arm-performix |
Arm 官方安装教程直接指向该仓库 |
源生技能集的优势体现在RISC-V领域知识与实际软件问题的紧密结合,如图2所示,面对开放指令集生态中多样化的处理器和软件环境,源生将架构特性、软件语义和真实性能证据联系起来,为优化方向提供专业依据。这些知识能够服务系统基础库、语言运行时、计算框架、数据库等不同层次的软件,使同一套分析方法在多种工程场景中复用。
图2 RISC-V源生技能集与Intel/Arm官方优化技能对比
0
3
多智能体协同层:多方证据共同支撑性能根因诊断与软件优化
性能采样可以告诉开发者时间主要花在哪里,却不能单独解释为什么慢。一个函数成为热点,可能源于计算密集、访存开销,也可能因为它被频繁调用。仅凭源码中出现了某个循环,或者某条指令理论上更快,都不足以证明实际程序能够从改写中获益。
Trace智能体将四类证据相互印证,共同支撑性能根因诊断:
-
Perf性能数据:提供真实工作负载下的热点与性能事件线索。
-
热点函数二进制代码:呈现实际指令、数据依赖与访存方式。
-
源代码:解释算法意图、数据结构与边界条件。
-
指令集特性:依据RISC-V指令集及向量扩展,判断优化方式及其适用条件。
处理器扩展、向量长度、源码版本和编译选项,也需与上述证据对应。Trace把诊断组织为证据清单、基线、分析边界、匹配技能扫描、根因蓝图生成、验证预测和完成自检七个阶段,形成带有问题位置、证据关联、适用条件、验证办法和历史参考补丁的优化蓝图Blueprint。后续补丁生成与对照测试据此推进,使一个优化判断既有依据,也能够被实验检验。
Craft智能体接收Trace的根因蓝图,在生成补丁计划前,从ISA领域知识层读取目标开源软件社区代码规范,将代码边界、接口约束和语义要求纳入代码生成与AI审查。CI智能体在指定的本地或远程环境中运行测试用例,采集结果与日志,并依据失败证据推进修复、复测。两者衔接候选补丁的生成与验证,为开源专家后续复核和调整提供可追溯依据。
0
4
工作流与运行层:建立从执行测试到开源优化补丁的AI工作流
同一段程序,在不同处理器上可能表现出不同的性能特征。能够编译和运行,只是软件适配硬件的起点。一个循环是否充分利用向量指令,数据加载是否造成等待,编译器是否生成了合适的指令序列,都会影响软件最终交付给用户的性能。
这类优化需要同时理解程序语义、编译结果和硬件特性。开发者既要从大量测试数据中找出值得分析的热点,又要判断瓶颈的真正原因,还要确保修改后的代码在边界条件、接口约定和项目规范上保持正确。当对象扩展到多款软件、上千个热点函数时,如何组织分析、保存证据和验证结果,就成为一项系统工程。
在源生智能体的AI工作流中,如图3所示,学生组织测试数据并推进任务,Trace综合性能数据、二进制、源码与ISA知识定位根因,Craft依据蓝图和社区规范生成候选补丁,CI执行测试并反馈结果。开源专家复核,修订后再次验证,形成有性能提升的补丁。
图3 源生智能体系统AI工作流
0
5
实施案例:两周优化19款软件验证跨软件栈通用性
此次成果的突出特点,是优化对象跨越了多种软件类型,如表2。测试覆盖19款软件、545项测试用例和2229个热点函数,涉及系统基础与安全库、语言运行时、数值计算与检索库、AI框架、图形多媒体以及数据库服务。两周内产出的101项复核有效补丁,展示了同一套诊断与验证方法在不同软件层次上的复用能力。
表2 19款软件及101项复核补丁的分布
|
软件层次 |
被测软件 |
复核补丁数 |
|
系统基础与安全库 |
glibc、OpenSSL |
7 |
|
语言运行时与标准库 |
OpenJDK、Go |
4 |
|
数值计算与检索库 |
OpenBLAS、oneDNN、Faiss |
28 |
|
AI框架与推理引擎 |
PyTorch、ONNX Runtime、MNN、vLLM、Caffe、MXNet |
23 |
|
图形视觉与多媒体 |
pixman、OpenCV、FFmpeg/H264/H265 |
31 |
|
数据库与缓存服务 |
Redis、MariaDB、PostgreSQL |
8 |
|
合计 |
19款软件 |
101 |
这些软件的实现方式和性能问题各不相同,优化仍可以沿着共同的方法展开:从实际性能数据出发,结合源码与二进制识别瓶颈,利用指令集知识形成方案,再通过测试检验效果。源生智能体面向操作系统全栈的软件优化需求开展建设,当前实践已覆盖从系统基础库到上层应用的多个关键层次,体现了其优化技术的通用性。
-
系统基础与安全库(7项):覆盖glibc、OpenSSL,优化字符串和内存访问、密码计算。X100上,glibc strrchr的2232项用例耗时比值的几何平均降低25.68%;SG2044(VLEN=128)上,OpenSSL通过RVV加速恒定时间查表,使Ed448签名吞吐从1858.6增至4377.2次/秒,提升135.5%。
-
语言运行时与标准库(4项):覆盖OpenJDK、Go,优化条件选择、位运算、SHA-256和哈希。OpenJDK启用Zicond后,SG2044上的不可预测分支负载速度达到基线约2.4倍;Go的TrailingZeros位操作5项基准中位性能提升约9.18%—106.72%,75组配对测试均改善。
-
数值计算与检索库(28项):覆盖OpenBLAS、oneDNN、Faiss,优化矩阵与向量计算、神经网络算子及量化编解码。X100单线程、512规模且单位步长下,OpenBLAS的drotm、srotm吞吐分别提升65.57%、222.42%;SG2044单线程、32/128/768维测试中,Faiss查询到编码的内积计算几何平均速度达到基线4.45倍。
-
AI框架与推理引擎(23项):覆盖PyTorch、ONNX Runtime、MNN、vLLM、Caffe、MXNet,优化激活、归约等算子。X100单核的4组ONNX Runtime卷积+ReLU测试中,性能达到基线1.13—2.40倍,输出误差为零;SG2044单核的MXNet sqrt微基准(4 Mi个float32元素)约达16.8倍,数值结果逐位一致。
-
图形视觉与多媒体(31项):覆盖pixman、OpenCV、FFmpeg/H264/H265,优化像素采样、图像归约、光流及视频解码。X100上,pixman的991组缩放测试中,中位像素耗时从10.0025降至7.2358纳秒;FFmpeg对指定900帧High 10视频单线程解码,吞吐提升5.19%。
-
数据库与缓存服务(8项):覆盖Redis、MariaDB、PostgreSQL,优化CRC校验、哈希、计时与有边界字符串扫描。X100上,64 KiB的Redis CRC64、MariaDB CRC32C微基准吞吐分别约为基线2.6倍、38.7倍;PostgreSQL在4 KiB简单查询负载的24轮配对测试中,TPS中位提升3.59%。
在研发产出方面,源生AI工作流展现了支撑小规模团队开展跨项目批量优化的能力。如图4所示,世界范围内2025年GitHub RISC-V相关PR共20,104项(按宽口径计算,即通过riscv、risc-v等关键词进行检索),双周约838项。本次实践由3名硕士研究生使用源生AI工作流开展分析与补丁生成,4名开源技术专家参与复核和调整,在双周内形成覆盖19款软件的101项有效补丁,其中98%为高价值的性能优化补丁。
上述成果表明,通过将自动化分析、补丁生成与专家复核相结合,源生智能体能够支持小规模团队在较短周期内高效完成RISC-V软件优化,为提升RISC-V软件研发效率提供了实践依据。
图4 2025年度GitHub RISC-V相关PR月度分布(全年合计20,104项)
0
6
源生团队介绍:科学家、指令集专家、开源技术专家共同打造源生智能体
源生智能体由科学家、指令集专家和开源技术专家共同打造。科学家把握研究方向与优化方法,指令集专家维护并监制ISA领域知识和优化技能,开源技术专家将知识与方法融入智能体、工具链和测试环境,推动系统建设与优化实践。三类专长共同支撑从性能诊断到有效补丁的完整过程。
>
>
科学家团队把握研究方向与优化方法
于佳耕、齐冀、刘宇航、姬晨晨负责凝练科学问题、规划研究方向,推动面向RISC-V开源软件优化的智能体方法研究,为系统建设提供科学判断与研究支撑。
>
>
指令集专家共同监制ISA领域知识与优化技能
由杨旺、刘雨冬、周全、宫小飞、马晓涵5位现任职的RISC-V国际协会技术组主席与副主席共同监制,将标准研讨与性能优化经验转化为可复用的ISA领域知识和优化技能。这些技术组织覆盖向量、数据中心、性能事件等方向,为优化领域知识的维护提供专业背景。
>
>
开源技术专家打造系统并推进工程落地
常秉善、张飞、倪金成、田宁等开源技术专家将工具链、测试环境、代码规范与社区协作经验融入系统,承担系统构建、优化运行及补丁工程质量把关。
许佳凯、王红岩、张瑾涵三位学生推进从测试数据到候选补丁的具体任务,与开源专家的复核和微调衔接,让研究方法、领域知识与工程实践在实际优化中协同发挥作用。
0
7
让优化成果和经验进入开源协作
随着更多软件与硬件场景被纳入验证,具体案例中的优化经验、适用条件和失败原因也可以继续回到知识维护环节。源生希望由此形成能够持续积累的工程方法,让更多开发者参与性能优化,帮助开源软件更充分地发挥RISC-V硬件能力。
源生智能体 101 项补丁追踪附表
本次实践的所有日志数据归档于:https://github.com/Yuansheng-Org/yuansheng-agents-log,共 101 项。
Trace、Craft、Review分别为诊断、补丁生成与开源专家复核后补丁的日志记录,合并到同一归档目录。
社区提交空白表示待向开源社区提交。






来源:RVEI基础软件工作部

点森科技 - 科技资讯_数码产品_互联网观察_智能硬件


