你好 👋

我是 曦客,一名折腾在代码与市场之间的独立创作者。

在这里,我会记录:

当前主力工具:Hermes Agent + Claude + 自建 SearxNG。 欢迎交流,欢迎打赏。

平庸已经不再是安稳的代名词。


GitHub · Email · Twitter

大饼夹技术

大模型与 Agent 极客工程系列(五):可扩展性机制——MCP、Skills 与多智能体协同的生态延伸

在上一篇《思维与规划——Reasoning 与 Planning 的高阶演进》中,我们完成了对 Agent “个体智慧”的解构。今天,我们迎来本系列的终结篇。如何让 Agent 突破单机与硬编码的桎梏,灵活接入外部世界的万千数据与工具?如何让它调用专家级工作流,甚至组织起一个高效的多智能体团队?本文将带你深度剖析 Agent 的可扩展性机制(Extensibility)。 一、 Model Context Protocol (MCP):连接外部世界的“USB 接口” 1.1 什么是 MCP? 在 2024 年底,Anthropic 提出了 Model Context Protocol(模型上下文协议,简称 MCP)。这是一项开放标准,旨在标准化 Agent 如何连接外部数据源、工具和资源,其角色类似于 IDE 领域的 LSP(Language Server Protocol)。 MCP 采用典型的 Client-Server 架构: +------------------+ +------------------+ | MCP Client | <=== stdio/SSE == | MCP Server | | (如 Claude Code) | | (如 GitHub/DB) | +------------------+ +------------------+ | | v v 呈现 Tool Schema 暴露 Tools/Resources MCP Server:运行在本地或远程,负责暴露具体的 tools(可执行函数)、resources(只读数据,如文件、数据库)和 prompts(预设模板)。 MCP Client (Host):即 Agent 的运行环境(Harness)。它通过传输层(本地通过 stdio,远程通过 SSE/HTTP)与 Server 建立连接,动态发现并调用这些工具与资源。 [!TIP] 黄金选题:做一个自己的 MCP Server 如果你想向社区展示你对 Harness 开发的热情,开发一个开源 of MCP Server 是绝佳的选题。你可以编写一个连接特定内部系统(如公司的 Jira、自定义的监控面板)的 MCP Server,任何兼容 MCP 的 Agent(如 Claude Code、Antigravity)都能瞬间获得与该系统交互的能力。 ...

June 28, 2026 · 曦客

大模型与 Agent 极客工程系列(四):思维与规划——Reasoning 与 Planning 的高阶演进

在上一篇《上下文与记忆——Harness 的灵魂与 Token 预算管理》中,我们深入探讨了如何精细管理 Agent 的工作集与长期记忆。今天,我们迎来 Agent 核心篇(三),探讨 Agent 的“高阶大脑”:Reasoning(推理/慢思考) 与 Planning(规划/战术部署)。当 Agent 具备了思考和规划的能力,它才能真正从“被动响应”走向“主动运筹”。 一、 Reasoning:慢思考的红利与代价 1.1 什么是推理模型的“慢思考”? 传统的 LLM(如 GPT-4, Claude 3.5 Sonnet)采用的是“直觉式”的快思考——模型接收到 Prompt 后必须立刻输出下一个 Token,思考与输出是同步的。 而以 OpenAI o 系列、DeepSeek-R1、Claude Extended Thinking 为代表的推理模型,引入了显式的思维链(Chain of Thought, CoT)。在给出最终答案之前,模型会在后台消耗大量的“思考 Token”进行逻辑推演、自我纠错和多路径尝试。这类模型通常是通过**可验证奖励的强化学习(RL)**训练出来的,极大地提升了多步推理、数学、算法设计等任务的成功率。 [传统快思考] Prompt ──> 立即输出答案 (易在复杂逻辑上犯直觉性错误) [推理慢思考] Prompt ──> [后台思考区: 论证方案 A -> 发现冲突 -> 修正为方案 B -> 自我验算] ──> 输出答案 1.2 什么时候推理会“帮倒忙”? 在工程落地中,推理并非万灵药。在以下场景中,开启推理往往会适得其反: 简单检索与格式化任务:如“将 JSON 转换为 YAML”或“提取段落中的日期”。这类任务不需要逻辑推演,开启推理不仅徒增 首字延迟(TTFT),还会带来高昂的 Token 成本。 过度思考(Overthinking):推理模型有时会表现出“画蛇添足”。例如执行一个简单的 API 调用,模型可能会在思考区反复论证该 API 的设计哲学,甚至推翻原本正确的简单方案,走入死胡同。 高频交互与低延迟场景:客服对话、语音助手等场景对响应时间极其敏感,无法容忍动辄数秒甚至数十秒的后台思考延迟。 [!TIP] 最佳实践:动态推理路由(Dynamic Reasoning Routing) 在 Harness 层引入轻量级路由机制。通过关键字或分类器评估任务难度: ...

June 28, 2026 · 曦客

大模型与 Agent 极客工程系列(三):上下文与记忆——Harness 的灵魂与 Token 预算管理

在上一篇《双生螺旋——Agent Loop、Tool Use 与 Harness 的边界》中,我们完成了 Agent 的身体构造。今天,我们迎来 Agent 核心篇(二),探讨被誉为 Harness 灵魂的模块:上下文工程(Context Engineering) 与 记忆系统(Memory)。在有限的 Token 预算和昂贵的延迟面前,如何精妙地管理模型的工作集? 一、 Context Engineering:戴着 Token 镣铐的极致探戈 1.1 什么是上下文工程? 在 Agent 的单次 API 调用中,送入大模型的全部输入被称为上下文(Context)。这其中包括:系统提示词(System Prompt)、工具定义(Tool Schemas)、检索到的相关资料(RAG)、历史对话与工具执行结果(Observation),以及当前记忆(Memory)。 +-------------------------------------------------------------+ | Context 构成 | | | | [ 1. 稳定前缀 (System Prompt + Tool Schemas) ] --> KV Cache | | [ 2. 动态检索 (RAG / Memory) ] | | [ 3. 实时对话历史 (History & Observations) ] | +-------------------------------------------------------------+ 上下文工程的核心目标非常明确:信号(有效信息)最大化、Token(成本与延迟)最小化、对 KV-Cache 极其友好。 ...

June 28, 2026 · 曦客

大模型与 Agent 极客工程系列(二):双生螺旋——Agent Loop、Tool Use 与 Harness 的边界

在上一篇《基础层——LLM API 的无状态本质与 KV Cache 的物理约束》中,我们探讨了如何通过优化大模型底层机制来榨干每一点推理性能。今天,我们正式进入 Agent 核心篇(一)。如何将一个“无状态”的语言模型,改造为能自主规划、调用工具的“有状态”助手?本文将带你解构控制流的底座 Agent Loop、桥梁 Tool Use,以及作为信任与安全边界的 Harness 这一层。 一、 Agent Loop:将无状态模型转化为有状态的“心脏” 1.1 什么是 Agent Loop? 大语言模型(LLM)本身是**无状态(Stateless)**的。要让它具备主动解决复杂问题的能力,我们必须在外部构建一个运行容器(Harness),通过一个持续运转的循环来维持状态。这个循环就是 Agent Loop,通常基于 ReAct (Reason + Act) 范式运行: graph TD Start([开始任务]) --> Input[当前上下文/Memory] Input --> LLM{模型推理} LLM -- 给出最终答案 --> End([任务结束]) LLM -- 输出 Tool Call --> Harness[Harness 执行工具] Harness --> Obs[获取 Observation/执行结果] Obs --> Append[更新上下文] Append --> Input 用最简化的控制流来表达,它的核心骨架如下: def agent_loop(task, tools): context = initialize_context(task) while not is_terminated(context): response = call_llm(context, tools) if response.is_final_answer: return response.answer for tool_call in response.tool_calls: observation = execute_tool(tool_call) context.append_observation(tool_call, observation) # 追加上下文 在这个循环中,Agent 经历了**“读文件 -> 跑命令 -> 看输出 -> 改代码 -> 再观察”**的闭环。 ...

June 28, 2026 · 曦客

大模型与 Agent 极客工程系列(一):基础层——LLM API 的无状态本质与 KV Cache 的物理约束

在大模型与 Agent(智能体)技术正在重塑软件工程的今天。作为一名极客开发者,若想构建出工业级、高性能的 Agent 系统,绝不能仅停留在“调包”阶段。我们必须深入大模型的底层物理世界,理解它的运行约束。本系列文章将带你从最底层的 API 与缓存开始,一步步解构控制流、记忆体、思维脑以及生态扩展。今天,我们从第一篇**《基础层——LLM API 的无状态本质与 KV Cache 的物理约束》**开始。 一、 LLM API:无状态的 HTTP 游戏 当我们通过 SDK 或是直接调用 OpenAI、Anthropic 的 Messages API 时,从网络协议的角度来看,它本质上就是一次普通的、无状态的 HTTP 调用。 1.1 协议解构 一次典型的 Messages API 请求体通常包含以下核心结构: { "model": "claude-3-5-sonnet-20241022", "messages": [ {"role": "system", "content": "你是一个资深架构师..."}, {"role": "user", "content": "帮我重构这段代码..."}, {"role": "assistant", "content": "好的,我们可以从以下几个方面入手..."}, {"role": "user", "content": "很好,那开始第一步吧。"} ], "temperature": 0.2, "max_tokens": 4096, "tools": [ { "name": "read_file", "description": "读取指定路径的文件内容", "input_schema": { ... } } ] } Messages(有序消息数组):角色包括 system(系统指令)、user(用户输入)和 assistant(模型回复)。这是一个显式维护的对话历史。 模型参数:控制生成多样性的 temperature、top_p,限制输出长度的 max_tokens,以及终止符 stop。 Tools(工具声明):向模型暴露的工具 JSON-Schema 定义。 响应体:支持普通的 JSON 结构化返回,或者通过 SSE(Server-Sent Events) 实现流式的文本/Tool Call 增量输出。 1.2 物理现实:服务端“不记事” 大模型提供商的 GPU 服务器在处理完你的请求并返回结果后,不会在服务器内存中保留你的任何对话状态。 ...

June 28, 2026 · 曦客

从垃圾堆里捡回旧手机:用 Scrcpy 把它榨干成第二生产力屏幕!

2026-06-21 · 曦客 · 极客折腾 · scrcpy · Linux · Android · 投屏 · 效率工具 从垃圾堆里捡回旧手机:用 Scrcpy 把它榨干成第二生产力屏幕! 相信大家的抽屉里都躺着至少一部“退役”的旧安卓手机。卖二手值不了几个钱,当备用机嫌卡,丢掉又觉得可惜。 今天,我就教大家如何用开源投屏神器 Scrcpy,把吃灰的旧手机改造成电脑桌面的**“第二生产力副屏”**! 💡 旧手机的“副屏”妙用场景 当把手机屏幕无延迟地投射到电脑桌面上,并且能直接用键盘和鼠标控制时,你会发现很多奇妙的玩法: 摸鱼/社交专屏:把微信、钉钉或 Telegram 挂在手机屏幕上,用电脑鼠标直接回复,主屏幕留给纯粹的写代码和查资料,再也不用频繁在电脑上切换窗口。 音乐控制台:挂着网易云音乐或 Spotify,切歌、看歌词只需鼠标点一下旁边的副屏,不占用宝贵的电脑主屏幕。 监控看板:放一个系统监控 App(如实时 CPU、内存占用率),或者放个股票盯盘、天气预报,把它变成你的桌面仪表盘。 开发真机调试:对于 Android 开发者来说,免去频繁低头看手机,直接在屏幕一侧调试,效率拉满。 🛠️ 实战踩坑:不要直接用 Apt 或 Snap 安装! 如果你使用的是较新的 Linux 系统(比如我正在使用的 Ubuntu 24.04)并且手机系统是 Android 14,那么直接按照网上的老教程安装,你大概率会踩进下面这几个天坑里: 坑 1:官方 Apt 源版本过低(断手断脚) 运行 sudo apt install scrcpy 安装的是老旧的 v1.25 版本。Android 14 内部修改了输入管理器的底层 API,导致旧版 scrcpy 无法注入触控事件——你能看到画面,但用电脑鼠标根本点不动它,并在终端里疯狂报错 NullPointerException。 坑 2:Snap 商店版本打包 Bug(根本打不开) 运行 sudo snap install scrcpy 确实能拿到新版,但在 Ubuntu 24.04 上会因为 Snap 容器内缺少 gpu-2404 的显卡驱动链,报错 gpu-2404-provider-wrapper not found,即便是手动连通了 mesa-2404 依然无解。 ...

June 21, 2026 · 曦客

再见 Gemini CLI!今天摸完 Antigravity CLI,我真香了

2026-05-21 · 工具推荐 ·AI · CLI · Google · Antigravity 再见 Gemini CLI!今天摸完 Antigravity CLI,我真香了 前天 Google I/O 2026 刚开完,技术圈的小伙伴估计都被 Gemini 3.5 Flash 和全新的大杀器 Google Antigravity 2.0 刷屏了。不过作为一名大半时间死守在终端里的终端重度依赖患者,最让我关注的其实是官方扔出的那枚重磅炸弹: 官方通告: 现有的 Gemini CLI 终端工具将于 2026 年 6 月 18 日正式停止服务,后续全力重组并入全新的 Antigravity CLI。 看到这个消息时,我的第一反应是折腾——毕竟之前的 Gemini CLI 陪我写了无数个脚本、排查了不知道多少次 VPS 的配置,用得顺手得很。但就在今天,我抱着试试看的心态卸载了旧爱,配置上了 Antigravity CLI。用完一下午之后,我只想说两个字:真香! 这玩意儿真不是挤牙膏的换皮改名,它在架构和体验上,直接把之前的 Gemini CLI 按在地上摩擦。今天就跟聊聊我最直观的几个升级体验。 1. 速度!Go 语言带来的纯粹丝滑 用过旧版 Gemini CLI 的兄弟应该知道,虽然功能过得去,但有时响应总有一种若隐若现的“滞后感”。 而全新的 Antigravity CLI 则是直接用 Go 语言重构的。今天我在终端里敲下第一条复杂指令时,那反应速度简直可以用“秒射”来形容。底层框架变轻、变快了,对于天天在黑框框里搬砖的工程师来说,哪怕是几百毫秒的延迟缩短,那种指哪打哪的爽快感也是无法拒绝的。 2. 彻底告别卡死:多エージェント(Multi-Agent)异步并发 这是最直观、也是最击中我痛点的一个升级。以前用 Gemini CLI 做复杂任务(比如让它帮我重构一段大代码或者批量写测试用例),终端就会直接进入阻塞死等状态。你要么开新窗口,要么就只能盯着光标发呆。 ...

May 21, 2026

折叠的硅谷与贬值的努力:AI时代,普通人如何重构资产杠杆?

2026-05-20 · 观点 ·AI · 人力资本 · 资产杠杆 折叠的硅谷与贬值的努力:AI时代,普通人如何重构资产杠杆? 科技浪潮最吊诡的地方在于:当顶尖的技术智囊在最核心的产业一线高喊“用技术改变世界”时,现实物理世界往往在用最冰冷的方式完成物理层面的“折叠”。 日前,《纽约时报》发布的一篇深度评述戳破了长期以来包裹在技术乐观主义下的幻象,其标题极其残酷——《硅谷正准备迎接永久的底层阶级》。在硅谷核心区,上层写字楼里是拿着大几十万美金年薪、热烈讨论大模型演进的AI研究员;而立交桥下,则是成片蔓延、无家可归的流浪汉篷帐。空间上的极度撕裂,折射出底层逻辑的根本性巨变:留给普通人单纯依靠贩卖脑力劳动来积累财富的时间窗口,正在加速关闭。 一、 时代传送带停摆:传统人力资本的“去货币化” 过去数十年,全球中产阶级享有一条默认的上升传送带:优质教育 → 技能内卷 → 白领雇佣 → 体面生活。然而,当人工智能开始成规模地替代复杂的脑力活动时,这条传送带瞬间失去了动能。 MicroStrategy(微策略)创始人迈克尔·塞勒(Michael Saylor)在最近的访谈中提供了一个极具挑衅性的视角:“今天你最不该做的事,就是妄想单纯通过‘有天赋’和‘努力工作’去赚钱。” 这种反直觉的论断背后隐藏着冰冷的商业本质:当下的AI正在将人类引以为傲的“才华与汗水”进行无情的去货币化(Demonetized)。 如果大模型只需耗费几美分的算力,就能在几秒钟内吞吐出媲美精英甚至大师级别的创作、代码与逻辑框架,那么人类个体赖以生存的传统“人力资本”,其商业估值就必然面临大范围的坍塌。 很多人寄希望于全民基本收入(UBI)等政策性救济,但现实是,保底的社会救济只能维持基本的生存底线,却永远无法出让真正的稀缺资源、尊严以及阶层跨越的机会。在全面自动化的系统升级面前,即便是精通提示词(Prompt)的精英打工人,也只是在为资产阶级加速提高生产率。一旦基座大模型迭代,被系统替代只是时间问题。 在这个大周期中,真正的分水岭不在于“你用不用AI”,而在于**“你是否拥有分配权,你是否在利用杠杆”**。 二、 拒绝无谓消耗:普通人突围的三大硬核资产杠杆 既然用肉身与机器拼效率注定沦为炮灰,普通人在生产关系重构的过程中,就必须转换思路,转向寻找对抗人力资本贬值的稀缺杠杆。真正落地的破局路径只有三条: 1. 资本资产化:打不过机器,就去买机器背后的“铲子” 既然我们无法在车库里手搓一个百亿参数的基座模型,就应该果断利用二级市场成为技术垄断红利的分享者。无论上层AI应用如何内卷,大模型竞争最确定缺少的依然是基础设施——算力、光模块、铜、以及电力。 英伟达(NVIDIA)、博通(Broadcom)等典型的基础设施企业,就是数字时代的“卖铲人”。通过配置这部分底层确定性标的,本质上是利用资本市场的杠杆,让全球顶级的科学家和工程红利为你打工,以此对抗人力通缩。 2. 工具顶配化:用极低溢价,雇佣全球最聪明的顶配助理 信息和认知的差级,正在以付费订阅的形式形成阶级鸿沟。当多数人还在使用免费的过时模型并抱怨其“无用”时,头部的探索者已经通过极低的真金白银完成了生产力工具的代际升级。 无论是 ChatGPT Plus、Claude 顶配、xAI 还是 NotebookLM,每个月数十美元的订阅费,折算下来不过是一两顿饭钱。但这笔极小的成本,为你换来的是全天候不间断运转的全球顶级大脑。这是数字时代赋予普通人最便宜、最硬核的智力外挂,别在决定生产力上限的底层工具上省钱。 3. 个人品牌化:构建数字分身,践行“一人公司”的杠杆思维 在传统的公司架构内部,个体的价值是极易被折旧和抹杀的。在这个瞬息万变的周期中,保护自己最好的方式就是将个人能力公开化与资产化。 你需要利用互联网和自媒体作为杠杆,记录你解决的行业痛点、你沉淀的AI工作流、甚至你踩过的商业坑洼。将这些交付物转变为网络上的文字、代码和视频,以此构建属于你自己的数字分身。唯有数字资产能够脱离你肉身的时间限制,在睡后继续帮你跑业务、建立信任并锚定全新的生产关系。 三、 结语:在物理摩擦中寻找不可替代的温度 世界正在加速走向数字化与算法化,但请记住,真正的深度合作与高级别的信任,依然只发生在真实的物理世界中。 在拼命构建数字分身的同时,我们更应该回归线下,去见具体的人,去喝一杯具体的酒,去产生那些AI永远无法复刻的“物理摩擦”。那些见过面、握过手、产生过眼神交汇的连接,才是一切商业深度合作的最底层基石。 在这个时代,平庸已经不再是安稳的代名词。但好在,这同样是一个前所未有地向“愿意折腾的人”敞开工具红利的时代。 **握紧你手里的工具,重新配置你的资产牌效。**愿我们都能在被折叠的巨变中,折腾出属于自己的活路。 💡 读者互动 迈克尔·塞勒指出“努力与天赋正在被去货币化”,面对人力资产急速贬值的未来,你是否已经开始寻找并配置自己的“卖铲人”与“数字资产”?欢迎在评论区留下你最具视角的思考。

May 20, 2026

别再用Playwright了!这款开源项目用C++源码级补丁吊打所有反检测浏览器

用Playwright写爬虫,被Cloudflare拦过、被FingerprintJS标记过、reCAPTCHA v3只拿到0.1的机器人分数——这些问题,大概每个做过网页自动化的人都遇到过。 playwright-stealth试过,undetected-chromedriver也装过,每次Chrome更新都要祈祷脚本别挂。最近我发现了一个项目,思路完全不一样:直接在C++源码层改Chromium,编译成新的二进制。效果也完全不一样——30/30反检测测试全部通过,reCAPTCHA v3拿到0.9的人类分数,而且完全免费、MIT开源。 这个项目叫 CloakBrowser,GitHub 9.3k星。 ...

May 14, 2026

2026年8月比特币eCash硬分叉:你需要知道的一切

Drivechain 是什么? Drivechain 是比特币开发者 Paul Sztorc 提出的侧链方案,通过 BIP 300/301 实现。其核心机制是:用户将 BTC 锁定在主链上,即可在侧链获得等量资产进行各种应用。侧链交易由比特币矿工通过"盲合并挖矿"(Blind Merge Mining)保护,矿工无需运行专用软件即可同时获得主链和侧链手续费。Sztorc 认为 Drivechain 可解决比特币扩容困境,同时保持主链稳定。 eCash 分叉如何运作? 2026 年 8 月(约 964,000 区块高度),比特币将迎来一次硬分叉,新链名为"eCash"。所有 BTC 持有者在快照时将按 1:1 比例获得 eCash 代币——持 1 个 BTC 自动获得 1 个 eCash。新链基于 Bitcoin Core 代码,挖矿算法同为 SHA-256d,但会在创世区块进行一次性难度重置:最初 24 个区块以最低难度挖矿,之后由 DarkGravity 算法根据实际出块速度动态调整难度(Will Difficulty Adjustment)。 eCash 计划上线时部署 7 条侧链,涵盖去中心化交易所、隐私功能、预测市场、NFT 等应用。 ...

May 8, 2026