基准与聚合榜单调研
公开基准与聚合榜单调研
调研日期:2026-08-13
问题:benchlm.ai / llm-stats.com 这类聚合榜单背后的基准数据集有多大?跑一遍需要多少时间和算力?
一句话结论
基准数据集小得出乎意料,算力几乎不是问题——真正的成本来自推理 token 和 agent 多轮,而不是数据量。
更值得注意的是第二点:这些聚合站大多不自己跑基准,而是抓取公开分数,而公开分数之间的可比性远比想象中差。
一、基准到底有多大
主流基准的规模
基准
题量
类型
AIME(单年)
30
数学竞赛,数值答案
CritPt
70
物理推理
Terminal-Bench v2.1
89
终端 agent 任务
𝜏³-Banking
97
工具调用 agent
AA-LCR
100
长上下文推理
ARC-AGI-2(公开评测集)
~120
视觉推理
HumanEval
164
Python 函数补全
GPQA Diamond
198
研究生级四选一
GDPval-AA v2
220
真实工作任务
SciCode
288 子问题
科研代码 ...
TSvsPYTHON在Agent应用开发的优劣势
TypeScript vs Python 在 Agent 应用开发中的优势对比
Python 是当前 Agent 生态绝对主流(LangChain、LlamaIndex、AutoGPT、各类 LLM SDK),但 TypeScript(TS/Node.js) 在 Agent 工程化、生产部署、前端打通、高并发场景有非常明确的优势,同时也存在生态短板。下面聚焦Agent 开发场景,只讲 TS 相对 Python 的优势,顺带点明局限。
TypeScript 在 Agent 开发的核心优势
1. 强类型系统:大型 Agent 项目可维护性显著提升
Agent 代码复杂度来源:多工具调用、多轮上下文、Agent 状态流转、复杂 Prompt 模板、工具入参出参、多 Agent 协作、记忆模块。
TS:静态类型、Interface、Generic、Zod 生态,可对:Agent 状态、工具参数、LLM 结构化输出、记忆数据、消息历史做类型约束。
配合 Zod 做 LLM 输出 Schema 校验:编译期 + 运行期双重校验,减少 LLM 返回非法 JSON 导致 Agent 崩溃。
多 ...
模型测评体系_项目总结与实际测试
敬请期待。
TencentDB_技术解析与体验分析
TencentDB-技术解析与体验分析
项目: Tencent/TencentDB-Agent-Memory — 让 Agent 沉淀经验,让人专注创造。
GitHub: https://github.com/Tencent/TencentDB-Agent-Memory
目录
项目定位与核心命题
竞品格局
技术栈与技术实现路线
功能清单
使用方法与工作流程
实现效果与用户价值
可提炼的方法论
局限与风险
可优化项
真实体验与体验分析
附录:关键文件索引与注释
一、项目定位与核心命题
定位
面向 AI Agent 团队的**「记忆 Hub」。核心理念一句话——「让经验沉淀、流动,然后被下一位 Agent 直接继承」**。其价值主张链条:
1已有信息 → 可复用记忆资产 → 更少 Turns → 更少返工 → 更稳定的结果和更高的效率
要解决的实际痛点
换一个 Session,同样的背景(项目、文档、结论)要重新讲一遍
换一个 Agent,文档要从第一页重读
一套已经跑通的做法,下次还要从头摸索一遍
关键约束(如「别重构旧鉴权模块,移动端还在用」)这种高代价上下文,不该靠人每 ...
OpenViking_记忆库理论与工具分析及个人体验(初期探索)
OpenViking-记忆库理论与工具分析及优化方案
项目: volcengine/OpenViking — AI 智能体的上下文数据库。
GitHub: https://github.com/volcengine/OpenViking
分析基线: main @ afc54b01(2026-08-26),领先最新 release v0.4.16 共 69 个提交。
目录
项目定位与核心命题
竞品格局
技术栈与技术实现路线
功能清单
使用方法与工作流程
实现效果与用户价值
可提炼的方法论
局限与风险
可优化项
真实体验与体验分析
附录:关键文件索引与注释
一、项目定位与核心命题
定位
面向 AI Agent 的**「上下文数据库」。核心理念一句话——「把 Agent 的记忆从黑盒向量库,改造成一个可寻址、可分层、可审计的虚拟文件系统」**。其价值主张链条:
1黑盒向量检索 → viking:// 可寻址文件系统 → 分层按需加载 → 更少 token、更准召回 → 可调试、可审计
要解决的实际痛点
不可寻址:只能靠相似度撞运气,无法确定性地说「去看我的编码偏好」
不可分层: ...
LLM_Wiki_技术分析和个人体验
LLM Wiki 技术分析报告
分析对象:nashsu/llm_wiki: LLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。
版本:v0.6.9(git tag v0.6.9,commit 723e259)
分析日期:2026-08-18
说明:本文结论均基于源码阅读,文中标注的 文件:行号 可直接定位。与 README 描述不一致处已单独标注。
目录
一、项目定位与核心命题
二、技术栈
三、技术实现路线与方法
四、实现功能清单
五、使用方法与工作流程 ...
agentmeory-技术全解
agentmemory 技术全解(AI生产)
分析对象:@agentmemory/agentmemory v0.9.29(Apache-2.0)
定位:面向编程 Agent 的本地长期记忆服务,运行在 iii-engine 之上
本文结构:
第一部分 架构与核心算法 —— 检索、索引、图、生命周期、容错、评测
第二部分 读写链路与功能模块 —— 端到端路径 + 各功能实现(含流程图)
第三部分 优势与优化建议 —— 基于全量代码通读的评估
目录
第一部分 架构与核心算法
总体架构
核心数据模型与存储
混合检索:三路召回 + RRF 融合
BM25 检索实现
向量索引实现
图检索算法
查询扩展与重排
记忆生命周期算法
记忆价值模型:保留评分与遗忘
工程容错算法
评测与基准数据
第二部分 读写链路与功能模块
完整端到端路径:从提问到重启后召回
保存路径细节
拉取路径细节
Sessions
Timeline
Lessons
Actions / Frontier / Routines
Crystals
Relations
Patterns
Profile
Working Me ...
AgentLoop调优方法综述
Agent Loop 调优方法综述
1. Agent Loop 概述
Agent 与传统的 LLM Chat 最大的区别在于,它不仅需要生成自然语言,还需要具备规划(Planning)、推理(Reasoning)、工具调用(Tool Calling)、环境交互(Environment Interaction)以及自我修正(Reflection)等能力。因此,一个完整的 Agent 通常采用循环执行(Agent Loop)的方式完成复杂任务,而不是一次性生成最终答案。
典型的 Agent Loop 可以表示为:
12345678910111213141516171819202122User Input │ ▼ Reasoning(理解任务) │ ▼ Planning(制定计划) │ ▼ Action(调用工具) │ ▼ Observation(获取反馈) │ ▼ 是否完成? │ 否 ───────► 回到 Reasoning │ 是 ▼ Final ...
《禅游斗地主》综合分析案AI辅助
《禅游斗地主》综合分析案(AI辅助)
一、项目基础概况
《天天斗地主(真人版)》是禅游斗地主的 “初代基本盘”,《禅游斗地主》是它的 “品牌升级 Pro 版”,两者并行运营,共同撑起禅游的斗地主品类大盘。
《天天斗地主(真人版)》是禅游的初代王牌,是后者的玩法与用户基础
这款产品 2013 年前后正式推出,是禅游科技的第一款核心斗地主产品,早期主打卡通休闲画风,以经典癞子、欢乐斗地主玩法为主,依托手机预装、应用商店渠道快速起量:2016 年月活突破 1000 万,2017 年累计注册用户破 1 亿,是禅游科技 2019 年港股上市时的核心营收支柱,当年贡献了公司超 7 成的总收入禅游。
《禅游斗地主》是品牌升级后的旗舰款,承接直播红利而生
随着短视频直播流量崛起,禅游在原有斗地主产品的研发经验基础上,推出了以公司品牌 “禅游” 直接命名的升级版本,相当于从通用产品名升级为品牌专属款。它并非简单换皮,而是在美术、玩法、体验上做了全面升级,专门适配抖音等直播渠道的内容传播与用户转化,是目前禅游对外主推的斗地主旗舰产品。
研发与发行主体:禅游科技(港股上市背景、腾讯系团队基因)
产 ...
阶段性文章总结
阶段性总结
整理医学超声图像处理、3D Gaussian Splatting(3DGS)及大语言模型(LLM)相关文献,按发表时间排序,供后续研究参考。
目录
1 医学超声图像处理
1.1 U-Net(2015)
1.2 EchoNet-Dynamic(2020)
[1.3 nnU-Net(2020/2021)](#13-nnu-net20202021)
1.4 SAM-Med2D(2023)
1.5 超声分割系统综述(2025)
1.6 超声 AI 综合综述(2025)
2 3DGS 系列(含 NeRF)
2.1 NeRF(2020)
2.2 3D Gaussian Splatting(2023)
2.3 Mip-Splatting(2023/2024)
2.4 2D Gaussian Splatting(2024)
2.5 4D Gaussian Splatting(2024)
2.6 FastGS(2025)
2.7 MedGS(2025)
2.8 3DGS 综合综述(2024)
3 LLM 及医学超声 LLM 自主性
3.1 LLaMA(2023)
3.2 ...






