Tech
[开源软件] 折腾了一个 Go Agent:魔改 Runtime + Hybrid RAG + llama.cpp + WebGPU,分享一下实现
定的业务场景是企业公文写作,本地 Embedding/Rerank 和模型推理也一起整合进来了,不只是套一层 Agent 编排。
整体链路是文档解析 → Hybrid RAG 召回 → Rerank → Agent Tool 调用 → 证据约束生成,Web 端用 WebGPU 跑 Embedding/Rerank ,桌面端用 llama.cpp 跑本地模型。
llama.cpp 端还做了点优化,cuda 版本对块对角矩阵的计算有问题,原版全部计算了,浪费了大量时间。
这块是朋友帮助下 codex 帮忙改的,当时测试的时候发现同样一份测试用例 valkun 需要 3s 就能 rerank 完,cuda 版本居然要 10s 。
以下是核心功能演示视频。
https://cac.opple.com/yc-media/getFile?id=bc58421664e24de799260e7c677ebc8a#.mp4
项目地址: https://github.com/helpleness/openinkflow
网站地址: https://doc.inkflowa...
Read the full discussion on V2EX
This article was aggregated from V2EX. Click to join the conversation.
View on V2EX