Agentic Workflows · Agents · LLMs

让智能体从演示,
走向生产环境。

Defl:N 是一个专注 Agentic 工作流、智能体与大模型工程的研究工作室。 我们研究的是同一个问题:当模型不再被围观,而是真的去干活, 怎么让它稳定、可解释、可回滚。

研究方向
3向
接入模型与工具
20+
评测样本
1.2k
核心团队
4人
Capabilities / 能力

从一个 prompt,
到一套能跑的系统。

智能体的每一层我们都亲手搭过:编排、模型接入、工具、记忆、评测。不做只能演示的半成品——能接进真实业务,才算数。

4 项

Agent 编排与工作流

把开放式的任务拆成可验证的步骤图。状态显式、失败可恢复,长链路跑得完也说得清。

  • 任务分解
  • 状态机 / 图编排
  • 重试与回滚
  • 人机协同
4 项

模型接入与推理

多模型路由、推理服务与成本控制,让模型成为可替换的组件。

  • 多模型路由
  • vLLM / 本地推理
  • 缓存与量化
  • 成本核算
3 项

工具调用与协议

Function Calling 与 MCP 落地,权限与沙箱一样不能省。

  • Function Calling
  • MCP
  • 权限与沙箱
3 项

记忆与检索

让智能体记住该记的,忘掉该忘的,上下文不被噪声撑爆。

  • RAG
  • 向量检索
  • 长期记忆

评测与可观测

Agent 的可靠性不靠感觉。先建回归集和 Trace,再谈能力提升——跑分只是起点,护栏才是底线。

  • Trace 与回放
  • 回归评测
  • 在线护栏
  • 可观测性
Process / 方法

先定评测,
再谈能力。

每个阶段都有可交付、可验证的产出。智能体跑到哪一步、错在哪,你随时看得到。

  1. 01

    界定

    先想清楚这个任务值不值得交给智能体,以及怎么判断它做对了。评测标准先于实现。

  2. 02

    原型

    搭最小可跑的 agent loop,用真实样本喂它。尽早暴露不确定性,而不是把它藏进 prompt。

  3. 03

    评测

    把失败案例沉淀成回归集。每次改动都跑一遍,能力提升要能拿出数字。

  4. 04

    工程化

    补上错误恢复、权限边界与可观测性,再接进真实系统。不做只能演示的 demo。

  5. 05

    迭代

    线上 Trace 回流到评测集,形成闭环。模型在换,工作流要经得起换。

Research / 研究方向

四个问题,
我们一直在啃。

Agentic 工作流、智能体系统、大模型工程、可观测与评测。都是老问题的新形态——把不确定的东西,变成可控的工程。

Agentic 工作流 — 方向 01进行中

方向 01

Agentic 工作流

把开放式任务拆成可验证的步骤图,解决长链路里的状态管理、失败恢复与流程编排。目标是让智能体跑得完,也解释得清。

图编排
有状态
图编排
失败恢复
可回滚
失败恢复
  • 编排
  • 状态机
  • Human-in-the-loop
智能体系统 — 方向 02进行中

方向 02

智能体系统

工具调用、记忆、权限与多智能体协作。研究智能体在真实约束下如何稳定运行,而不是在 demo 里看起来很聪明。

协议
MCP
协议
权限
沙箱
权限
  • 工具调用
  • 记忆
  • 多智能体
大模型工程 — 方向 03进行中

方向 03

大模型工程

模型接入、路由、推理优化、评测与护栏。把大模型从「能聊」变成系统里一个可靠、可替换的组件。

路由
多模型
路由
评测
回归集
评测
  • 推理服务
  • 评测
  • 护栏
可观测与评测 — 方向 04进行中

方向 04

可观测与评测

Trace、回放、在线护栏与自动评测。没有可观测性的 Agent 系统,等于在生产环境里盲开。

全链路
Trace
全链路
  • OpenTelemetry
  • 回放
  • 护栏
Stack / 技术栈

用顺手的工具,不用最新的玩具。

模型在换、框架在变,选型只问一件事:这套东西明年还改得动吗。

编排 / Agent

  • LangGraph
  • MCP
  • Pydantic AI
  • Temporal
  • Vercel AI SDK

模型 / 推理

  • OpenAI
  • Anthropic
  • Gemini
  • vLLM
  • Ollama
  • LiteLLM

数据 / 基础设施

  • Python
  • TypeScript
  • PostgreSQL
  • pgvector
  • Qdrant
  • Docker
  • OpenTelemetry
Studio / 关于

一支小团队,只做一件事。

Defl:N 专注 Agentic 工作流、智能体与大模型工程。远程优先,代码公开在 GitHub。我们更愿意把一个问题啃透,而不是追着热点换方向。

我们在意的事

  • 先定义评测,再谈能力。
  • 不确定性要显式化,不能藏进 prompt。
  • Agent 要能回滚,不能只靠重试。
  • 能跑通、能复现,才算完成。
defln.config.ts
export const studio = {
  name: "Defl:N",
  motto: "Make the world a better place.",
  focus: ["agentic-workflows", "agents", "llm"],
  repos: "github.com/defl-n",
  remote: true,
  timezone: "UTC+8",
} as const;
Contact / 联系

在做 Agent,
或者正被它折腾?

代码都在 GitHub 上,欢迎直接开 Issue 或来聊。 如果你也在琢磨智能体怎么落地,我们大概有很多话可以说。

时区
远程 / UTC+8
回复
工作日 24 小时内