@ggchaos #18 “其他 Agent 也能接 API”——确实如此,现在很多大厂和成熟工具生态非常完备,功能和完成度上 Aether 作为一个个人开发的小项目自然没法相比。 商业产品很多需要登录账号、数据进云端库,或者绑定了特定的生态;而 Aether 的初衷就是为了满足我自己的需求:不想要中间层数据库,不想要繁重的平台绑定,只想用最纯粹透明的本地文件来管 Prompt 和历史,同时直连 API 干活。
0.9.1发布 这次更新主要围绕 Agent 核心、模型评测、自动路由和 UI 做了一轮比较大的升级。 🤖 Agent Core 重构 Tool Loop,加入 Plan → Act → Observe → Verify → Complete 状态流 新增独立的 Tool State Machine / Scheduler / Runtime 增强多维度执行预算、权限控制、循环检测和错误恢复 优化工具并发执行、缓存、Checkpoint、Audit Trace 改进 Prompt Injection 防护与工具路由 支持阶段感知的动态 Tool Router 🧪 Objective Arena 新增基于真实代码执行的 Objective Arena 支持模型在隔离 Workspace 中执行任务 自动运行 Verify Command 判断 Pass / Fail 记录 Token、成本、延迟等指标 支持个人 Benchmark / SWE-bench 风格任务集 Arena 结果可用于模型评分与自动路由 🧠 Model Router 新增 Model Advisor 根据任务类型、模型能力和个人使用数据进行模型推荐 Arena 数据可以反哺自动路由 支持不同模型 / Temperature 的并行对比 👀 Visual Verification 新增前端视觉验证能力 自动启动 Preview、截图并检查 Console / Runtime Error 支持将验证结果重新反馈给 Agent 进行修复 🗺️ RepoMap 新增项目结构与代码重要性分析 综合 Git Changes、Entry Points、Exports、依赖关系和 Prompt Relevance 根据任务复杂度动态调整上下文预算 减少无意义的项目代码注入 🎨 UI / UX 重构 Chat Input 与 Agent Timeline 增强 Tool Call / Plan / Verification 的实时可视化 新增 Post-Digital / Metalheart 等主题 优化整体视觉层级、间距和交互 Slash Actions、Effort、Token Estimate、Auto Routing 等能力进一步完善 🔧 其他 大量安全性、稳定性和错误处理修复 增强 Abort / Timeout / Permission 生命周期管理 完善 Usage / Cost / Metrics 统计 根据多轮 CodeRabbit / Devin Review / Greptile Review 进行了一轮集中修复 这次更新的核心方向:让 Aether 从“能调用模型的 AI 工作台”,进一步变成一个具备规划、执行、验证、评测和自适应路由闭环的 Local-first Agent Workbench。
Aether 大更新 这次更新主要围绕 Agent 核心、模型评测、自动路由、供应商管理、上下文理解与 UI 做了一轮较大规模的升级。 本次提交共涉及 82 个文件,+6,949 / -1,313 行,同时针对多轮 CodeRabbit、Devin Review 与 Greptile Review 进行了集中修复与重构。 🤖 Agent Core 重构 Tool Loop,明确 INIT → PLAN → ACT → OBSERVE → VERIFY → COMPLETE / ERROR 状态流 新增独立的 Tool State Machine / Scheduler / Runtime / Permission 模块 强化多维度执行预算:迭代次数、Token、时间、错误次数等 增强权限生命周期管理,支持超时、Abort 与 fail-closed 行为 加入循环检测、重复调用检测、错误分类与有限重试 优化工具并发执行,根据工具类型动态控制并发度 增加 Tool Cache、Checkpoint、Audit Trace、Execution Metrics 等运行时基础设施 支持 Plan / Todo / Steering 等过程控制 改进 Prompt Injection 防护,对外部网页内容进行隔离 支持并行读取独立资源,减少无意义的串行 Tool Call 新增 阶段感知的动态 Tool Router,根据 Explore / Build / Verify / Deliver 等阶段动态调整可用工具集合 🧪 Objective Arena 新增真正基于客观代码执行结果的 Objective Arena。 模型可以在独立 Sandbox / Shadow Workspace 中执行同一个任务 自动将模型输出的 Patch 应用到隔离环境 支持真实执行 "test / build / lint" 等 Verify Command 根据实际 Pass / Fail 结果进行客观比较,而不是只看模型生成文本 自动记录 Token、成本、延迟、Patch 应用情况与验证结果 支持 Baseline Verification,避免“原本就通过”的任务制造虚假胜负 支持 Abort、Timeout、运行去重等执行保护 Arena 结果可以自动写入个人 ELO 支持 Arena 2.0 Personal Benchmark,可以创建自己的任务集并长期运行 支持模型批量 Benchmark、结果统计与历史记录 支持 模型 × Temperature 的并行对比 提供 SWE-bench 风格的代码任务模板 最终形成: 任务 → 多模型执行 → 隔离验证 → 客观结果 → ELO → 路由反馈 🧠 Model Router / Model Advisor 这次把原本的模型推荐进一步升级成了一个真正的个人模型路由系统。 新增 Model Advisor 根据任务类型、模型 Family、能力先验进行初始评分 支持 Quality / Speed / Cost 等路由偏好 修复短 Prompt 被错误分类为其他任务类型的问题 引入 动态 ELO 权重 冷启动阶段主要依赖模型能力先验,随着真实使用次数增加,逐渐提高个人 Arena 数据的权重 将 Objective Arena 的客观结果反哺 Model Advisor 结合真实 Usage 数据中的延迟与成功率等指标 支持对路由结果给出原因、评分组成和置信度解释 也就是说,Aether 的自动路由开始从: “我觉得这个模型适合这个任务” 逐步转向: “模型先验 + 你的实际评测 + 你的真实使用数据” 🔄 供应商与模型管理 这是这次比较容易被忽略、但实际非常实用的一部分。 自动模型同步 点击“拉取模型”后自动获取供应商当前暴露的模型列表 自动新增供应商新出现的模型 自动删除供应商已经不再提供的旧模型 自动清理历史重复模型 如果当前主模型被供应商移除,会自动提升剩余模型作为主模型 防误删保护 供应商返回空列表时不会执行删除 网络错误、供应商暂时不可用时不会清空本地模型 OpenAI-compatible 模型列表支持分页 Anthropic 模型列表支持分页,并增加页数上限与游标停滞检测 如果模型列表无法确认完整,会直接终止同步,避免把“没拉到”误判成“已删除” 供应商体验 新增供应商 / 指定模型的 RTT 延迟测试 完善连接测试与错误提示 增强 API 请求失败后的多凭证轮换与冷却机制 OpenAI-compatible Provider 增加更多模型列表格式兼容 支持 Ollama 模型列表回退到 "/api/tags" 新增 一键检测本地 Ollama 自动创建 / 更新 Ollama Provider 自动同步本地模型 根据模型列表自动给出一个轻量模型推荐 👀 Visual Verification 新增前端视觉验证与自修复链路。 检测本轮 Agent 是否修改了前端文件 自动启动 Preview 使用 Offscreen Chromium 渲染页面 自动截图 检查 Console / Runtime Error 提取页面中的 Warning / Error 信息 将截图与错误信息重新反馈给 Agent 支持进入下一轮修复 因此前端任务开始具备: 修改 → Preview → Render → 检查 → 反馈 → 修复 的闭环。 🗺️ RepoMap / Context Intelligence RepoMap 进行了比较大的重构。 现在不只是简单把项目目录塞进 Context,而是综合考虑: Git Changes Entry Points Exports Symbols Dependency Reference Centrality Prompt Relevance 文件本身的重要程度 同时增加动态 Context Budget: 1280 2048 4096 8192 tokens 会根据任务复杂度决定需要多少项目上下文。 例如小 Bug 不需要把整个项目塞进 Prompt,而架构重构则可以自动扩大上下文预算。 目标就是: 更少的无意义 Context + 更高的有效代码密度。 🧩 Tooling / Patch Engine 这次也补强了 Agent 真正修改代码时的稳定性。 新增统一 Patch Engine 支持 Unified Diff 与 SEARCH / REPLACE 两种 Patch 格式 处理纯插入 Hunk 等特殊情况 自动规范化 CRLF / LF 改进 Patch Target Reset 新增 Fuzzy Match 支持空白差异、缩进变化与近似文本匹配 使用 Levenshtein 等策略提高 "edit_file" 在代码发生轻微变化后的命中率 对 Patch 冲突进行明确反馈,而不是静默失败 增加 ANSI 输出清理与工具结果处理 这部分主要解决的是: 模型输出的 Patch 并不总是精确,Aether 需要尽可能可靠地把它变成真正可应用的修改。 🧠 Context Compaction 上下文压缩进一步增强。 Token 估算更加细化 支持分层截断 长上下文自动寻找更合理的保留位置 对历史较久、内容较长的只读 Tool Output 进行 Folding 最近工具结果保持完整 Error / Fail 等重要结果不会被折叠 在保留关键上下文的同时减少历史工具输出对 Token 的占用 💬 Chat / Agent UX Agent 执行过程的可视化也做了重构。 新增完整 Agent Timeline Plan Step 与 Tool Call 按执行顺序交错展示 更清晰地区分 Plan / Act / Observe Tool Call、Verification、Execution 状态更加明确 重构 Agent Task Deck / Run Timeline 优化 Thinking Block 与 Tool Call Block 增强实时状态反馈 同时重做 Chat Input: 原生 Textarea 输入体验 Slash Actions / Slash Commands "@" 文件 / 符号引用 Token Estimate Effort Slider Auto Routing Agent Mode 输入内容 Token 预估 底部工具栏重新整理 去除原本多余的输入字符视觉 Hack 🎨 Visual / Theme 这次对 UI 进行了比较完整的一轮视觉重构。 引入 Post-Digital 设计方向 新增 Metalheart 主题 移除旧的 Glass 主题预设 重构聊天背景与视觉纹理 加入更加明确的层级、间距、边界与状态表达 Tool Timeline、Plan、Verification 的视觉语言统一 保留简洁的桌面工作台结构,同时增加实验性图形设计元素 整体设计方向从传统“AI App UI”进一步往: Post-Digital / Editorial / Technical Graphic / Brutalist 方向靠拢。 🧪 Benchmark UI Objective Arena 不再只是后端能力,而是进一步接入 UI: Benchmark Panel 重构 创建 / 编辑 / 删除个人 Benchmark 选择参与评测的模型 批量运行任务 查看模型运行结果 查看胜负、延迟、成本等数据 支持停止 Benchmark 提供任务模板 支持 Objective Arena 单独运行 🗂️ Session / Data 新增 Session Fork / 会话分支 Fork 时复制原会话配置与历史消息 同步生成对应 FTS 索引 保留 Persona / 配置等上下文 完善 Arena Benchmark 数据持久化 增加真实模型 Usage Metrics 支持统计模型请求量、平均延迟、成本与成功率 🌍 国际化与跨平台 更新 i18n 字典 重新生成全部 15 个 Locale 补充新的模型管理、Arena、Visual Verification、UI 等翻译 新增 "start.sh" Linux / macOS / WSL 可直接启动 TUI 支持 "--tui" / "--desktop" Terminal Agent Runtime 与 TUI 进一步向跨平台发展 🔐 安全、稳定性与工程质量 本次更新同时集中处理了多轮外部 Review 中发现的问题。 强化 Prompt Injection 防护 强化 SSRF / Web Navigation 安全检查 增强 Arena Sandbox 隔离 Verify Command 使用受限环境变量 增强 Abort / Timeout 生命周期处理 修复分页异常与分页死循环风险 修复 ELO 并发更
@ggchaos #18 “其他 Agent 也能接 API”——确实如此,现在很多大厂和成熟工具生态非常完备,功能和完成度上 Aether 作为一个个人开发的小项目自然没法相比。
商业产品很多需要登录账号、数据进云端库,或者绑定了特定的生态;而 Aether 的初衷就是为了满足我自己的需求:不想要中间层数据库,不想要繁重的平台绑定,只想用最纯粹透明的本地文件来管 Prompt 和历史,同时直连 API 干活。
0.9.1发布
这次更新主要围绕 Agent 核心、模型评测、自动路由和 UI 做了一轮比较大的升级。
🤖 Agent Core
🧪 Objective Arena
🧠 Model Router
👀 Visual Verification
🗺️ RepoMap
🎨 UI / UX
🔧 其他
这次更新的核心方向:让 Aether 从“能调用模型的 AI 工作台”,进一步变成一个具备规划、执行、验证、评测和自适应路由闭环的 Local-first Agent Workbench。
Aether 大更新
这次更新主要围绕 Agent 核心、模型评测、自动路由、供应商管理、上下文理解与 UI 做了一轮较大规模的升级。
本次提交共涉及 82 个文件,+6,949 / -1,313 行,同时针对多轮 CodeRabbit、Devin Review 与 Greptile Review 进行了集中修复与重构。
🤖 Agent Core
🧪 Objective Arena
新增真正基于客观代码执行结果的 Objective Arena。
最终形成:
任务 → 多模型执行 → 隔离验证 → 客观结果 → ELO → 路由反馈
🧠 Model Router / Model Advisor
这次把原本的模型推荐进一步升级成了一个真正的个人模型路由系统。
也就是说,Aether 的自动路由开始从:
“我觉得这个模型适合这个任务”
逐步转向:
“模型先验 + 你的实际评测 + 你的真实使用数据”
🔄 供应商与模型管理
这是这次比较容易被忽略、但实际非常实用的一部分。
自动模型同步
防误删保护
供应商体验
👀 Visual Verification
新增前端视觉验证与自修复链路。
因此前端任务开始具备:
修改 → Preview → Render → 检查 → 反馈 → 修复
的闭环。
🗺️ RepoMap / Context Intelligence
RepoMap 进行了比较大的重构。
现在不只是简单把项目目录塞进 Context,而是综合考虑:
同时增加动态 Context Budget:
会根据任务复杂度决定需要多少项目上下文。
例如小 Bug 不需要把整个项目塞进 Prompt,而架构重构则可以自动扩大上下文预算。
目标就是:
更少的无意义 Context + 更高的有效代码密度。
🧩 Tooling / Patch Engine
这次也补强了 Agent 真正修改代码时的稳定性。
这部分主要解决的是:
模型输出的 Patch 并不总是精确,Aether 需要尽可能可靠地把它变成真正可应用的修改。
🧠 Context Compaction
上下文压缩进一步增强。
💬 Chat / Agent UX
Agent 执行过程的可视化也做了重构。
同时重做 Chat Input:
🎨 Visual / Theme
这次对 UI 进行了比较完整的一轮视觉重构。
整体设计方向从传统“AI App UI”进一步往:
Post-Digital / Editorial / Technical Graphic / Brutalist
方向靠拢。
🧪 Benchmark UI
Objective Arena 不再只是后端能力,而是进一步接入 UI:
🗂️ Session / Data
🌍 国际化与跨平台
🔐 安全、稳定性与工程质量
本次更新同时集中处理了多轮外部 Review 中发现的问题。