将开源大模型转化为非自回归决策原语(Choice<T>, Noul, Score)。语法层 100% 保证 Schema 合规,后验概率经数学标定,专为工作流路由与智能体护栏打造。
答案是肯定的。多项独立实测证明:通用开源模型无需微调,仅靠 Schema 强制解码,其决策精度与专用 Jev 在统计学上置信区间重叠。
通用巨模型上限。单次调用计费昂贵,延迟约 300~600ms,需依赖闭源云厂商。
专用微型决策模型。RLCD 标定,~25-45ms 极低延迟,但属于闭源商业付费产品。
无需专项训练。仅依靠 SGLang 词表约束解码,与 Jev 置信区间重叠,完全私有化且自由可审计!
横向评测 Jev vs GPT-5.6 vs openjev-sglang,实测开源模型精度逼近 Jev,95% 置信区间重叠。
独立复现仓库:评测 Qwen 3.8 27B / Cerebras 结构化输出 vs Jev,公开完整 Raw Results 与代码。
100 条评论 × 3 次复现对比,深度分析通用大模型准确率上限与极速轻量模型的速度/成本优势。
TypeSafe 官方博客:定义无思维链(No-CoT)类型化概率决策原语与 RLCD 标定技术背景。
输入任意业务上下文,体验 OpenJevPro 如何瞬时输出严格类型化、概率已标定的决策分布。
完美对齐 TypeSafe Jev 语义规范,兼顾原生开源 LLM 的加速吞吐。
基于离散 Enum 类型的多分类路由决策。在词表层限制合法候选范围并计算条件序列对数似然,零格式解析错误。
二元断言判断器($P_{true}, P_{false}$),提供严谨的置信区间与不确定度量,专用于智能体策略门控与内容合规护栏。
有序严重级或优先级评分原语。根据各分段概率质量分布计算连续数学期望值,杜绝离散幻觉跳变。
针对非思考决策优化的极速分级策略,支持单卡边缘与云端兜底弹性调度。
| 层级 (Tier) | 模型架构 | 激活参数量 | 典型延迟 | 适用业务场景 |
|---|---|---|---|---|
| Tier 1: 极速边缘门控 | Qwen3-1.7B / 4B (Dense) | 1.7B / 4B | < 50ms | 超高 QPS 意图初筛,二元门控 (/no_think 模式) |
| Tier 1: 多模态边缘 | Gemma 4 E4B (Vision/Text) | 4.5B Effective | ~60ms | 票据、截图、文档等视觉状态即时决策 |
| Tier 2: 黄金标准推荐 | Qwen3-30B-A3B (MoE) | 3B Active / token | 60-90ms | 生产级工作流路由:享受 30B 表征容量,仅耗 3B 推理算力 |
| Tier 2: 单卡企业私有 | gpt-oss-20b (MXFP4 MoE) | 3.6B Active | ~80ms | 企业本地单张 GPU 部署,宽松 Apache 2.0 协议 |
| Tier 3: 复杂长尾仲裁 | DeepSeek-V4.1-Flash / V3.2 | 8B~16B Active (552B) | 200-400ms | 多步骤工具调用仲裁,低置信度未知样本弹性兜底 |
开箱即用的 Python SDK,完美兼容本地 vLLM、SGLang 及标准 OpenAI 兼容服务。
from enum import StrEnum
from openjevpro.schemas import ChoiceDecision
from openjevpro.client import OpenJevProClient
class TicketRoute(StrEnum):
BILLING = "billing"
TECH_SUPPORT = "tech_support"
SECURITY = "security"
ESCALATE = "human_review"
# 连接本地 SGLang / vLLM 或外部端点
client = OpenJevProClient(
base_url="http://localhost:8000/v1",
model="Qwen/Qwen3-4B-Instruct",
temperature_scaling=1.30,
abstain_threshold=0.45
)
decision: ChoiceDecision = client.decide_choice(
state={"ticket_text": "Brute-force login attempt detected from untrusted subnet."},
candidates=TicketRoute,
criteria="Classify incoming ticket to the appropriate response team."
)
print(f"Selected Action: {decision.value}") # 输出: 'security'
print(f"Confidence: {decision.confidence:.2%}") # 输出: '92.40%'
print(f"Abstained: {decision.abstained}") # 输出: False
双轨授权设计:兼顾开源学术研究的自由开放与企业生产部署的合规保障。
100% 自由开放,专为个人学习、学术科研、非营利组织及非商业项目设计。
适用于企业生产环境部署、商业 SaaS 嵌入、托管 API 运营或商业闭源分发。