Agent 编排与工作流
把开放式的任务拆成可验证的步骤图。状态显式、失败可恢复,长链路跑得完也说得清。
- 任务分解
- 状态机 / 图编排
- 重试与回滚
- 人机协同
Defl:N 是一个专注 Agentic 工作流、智能体与大模型工程的研究工作室。 我们研究的是同一个问题:当模型不再被围观,而是真的去干活, 怎么让它稳定、可解释、可回滚。
智能体的每一层我们都亲手搭过:编排、模型接入、工具、记忆、评测。不做只能演示的半成品——能接进真实业务,才算数。
把开放式的任务拆成可验证的步骤图。状态显式、失败可恢复,长链路跑得完也说得清。
多模型路由、推理服务与成本控制,让模型成为可替换的组件。
Function Calling 与 MCP 落地,权限与沙箱一样不能省。
让智能体记住该记的,忘掉该忘的,上下文不被噪声撑爆。
Agent 的可靠性不靠感觉。先建回归集和 Trace,再谈能力提升——跑分只是起点,护栏才是底线。
每个阶段都有可交付、可验证的产出。智能体跑到哪一步、错在哪,你随时看得到。
先想清楚这个任务值不值得交给智能体,以及怎么判断它做对了。评测标准先于实现。
搭最小可跑的 agent loop,用真实样本喂它。尽早暴露不确定性,而不是把它藏进 prompt。
把失败案例沉淀成回归集。每次改动都跑一遍,能力提升要能拿出数字。
补上错误恢复、权限边界与可观测性,再接进真实系统。不做只能演示的 demo。
线上 Trace 回流到评测集,形成闭环。模型在换,工作流要经得起换。
Agentic 工作流、智能体系统、大模型工程、可观测与评测。都是老问题的新形态——把不确定的东西,变成可控的工程。
方向 01
把开放式任务拆成可验证的步骤图,解决长链路里的状态管理、失败恢复与流程编排。目标是让智能体跑得完,也解释得清。
方向 02
工具调用、记忆、权限与多智能体协作。研究智能体在真实约束下如何稳定运行,而不是在 demo 里看起来很聪明。
方向 03
模型接入、路由、推理优化、评测与护栏。把大模型从「能聊」变成系统里一个可靠、可替换的组件。
方向 04
Trace、回放、在线护栏与自动评测。没有可观测性的 Agent 系统,等于在生产环境里盲开。
模型在换、框架在变,选型只问一件事:这套东西明年还改得动吗。
Defl:N 专注 Agentic 工作流、智能体与大模型工程。远程优先,代码公开在 GitHub。我们更愿意把一个问题啃透,而不是追着热点换方向。
export const studio = {
name: "Defl:N",
motto: "Make the world a better place.",
focus: ["agentic-workflows", "agents", "llm"],
repos: "github.com/defl-n",
remote: true,
timezone: "UTC+8",
} as const;代码都在 GitHub 上,欢迎直接开 Issue 或来聊。 如果你也在琢磨智能体怎么落地,我们大概有很多话可以说。