LLM / Agent
技术探索者
记录学习心得,分享技术实践
Building the future of Coding Agent @ ByteDance
关于我
工具
最近文章
-
TQQQ EMA 5/30 回测验证:170% 年化神话与 40 年样本偏差检验
一个声称年化 170-200% 的 TQQQ 均线策略,用 10 年真实数据回测只有 39%,跑输买入持有。更关键的:用 NDX 指数 40 年历史构造模拟 TQQQ,检验策略在互联网崩盘、金融危机中的真实表现——最大回撤 -92.2%,持续 9 年。
-
订单流交易全图谱:从盘口到微观结构,玩法、争论与真相
系统梳理订单流交易的完整玩法:三个数据视角、四个核心机制、四个策略原型,以及国际社区关于"订单流到底有没有效"的激烈争论。附 MBO 数据带来的信息差分析。
-
Agentic RL:一篇大综述告诉你 RL 怎么把 Agent 从写死的脚本变成自适应系统
25 位作者、500 篇参考文献、TMLR 发表。这篇 survey 形式化了从 LLM RL(RLHF/DPO)到 Agentic RL 的范式转变,并给出了以能力维度和任务域两条轴线的完整分类法。我们翻译并解读了核心框架和与 Coding Agent 最相关的部分。
-
SWE-bench Verified 30 个月:从 1.96% 到 80.9%,Coding Agent 是怎么做到的
30 个月,从 1/50 到 4/5。本文翻译并解读 AgentMarketCap 的 SWE-bench Verified 完整演进史,拆解每个跳变的驱动因子,以及在 saturation 之后该看什么。
-
Coding Agent 的 Harness Engineering:如何把 AI 代码的质量关
Agent = Model + Harness。Birgitta Böckeler 从 Thoughtworks 的实践出发,系统性地拆解了如何为 Coding Agent 设计一套前馈+反馈的控制系统。本文结合我们的思考和实践经验,对原文做了翻译和注解。