企业高重复场景组合节省 70%~90%
模型感知压缩、私有池、Provider Cache、exact / semantic cache 与成本路由协同工作。
55%~75%
70%~90%
GistToken 是面向商业模型调用的成本治理层。在不改变现有 OpenAI-compatible 接入方式的前提下,系统识别可压缩提示词、可复用上下文和可缓存的稳定内容,并在质量约束下选择合适的优化路径。
从个人开发到企业 RAG / Agent,每一次请求都会沉淀输入、缓存命中、商业 API In / Out、响应恢复与节省金额。没有实际节省时自动回退原文,让降本结果可验证、可审计、可持续。
模型感知压缩、私有池、Provider Cache、exact / semantic cache 与成本路由协同工作。
55%~75%
70%~90%
每种压缩模式都会比较实际 Token 数;没有节省时不转发更长内容,也不虚报节省。
不增加
真实可查
凭证按用户与租户隔离并采用带版本的认证加密;仅在本人授权调用转发时短暂解密,管理员和运维人员不能查看、导出或借用。
认证加密
不落库
会话、访问 Token 与 SDK 共用 OpenAI-compatible 网关,按需配置商业模型与压缩模式。
OpenAI 兼容
统一治理
在 Trace 与 Dashboard 中查看输入、缓存、商业 API Out、响应恢复与成本口径,避免黑箱节省。
In / Out
可审计
Compression Modes
从不增加 Token 的可逆无损封装,到面向 RAG、Agent 和高重复流量的组合节省,均可在登录后按请求选择。
仅在封装后的 Token 不高于原文时启用;否则自动原文直通,保持字节级内容一致。
清理重复、空白和套话,优先保留事实、数字、实体、格式和关键约束。
兼顾语义完整、可读性与节省效果,是普通问答、写作和业务指令的默认选择。
提取高信号内容并整理为紧凑任务结构,适合可接受摘要化表达的高频工作流。
通过 AST 或符号提取保留导入、调用关系、错误上下文和关键注释,压缩冗余代码片段。
围绕查询裁剪无关片段,保留来源、引用和关键证据,降低长文档上下文成本。
把历史会话编译为目标、决策、约束、待办和偏好,让对话越长越不拖累成本。
叠加私有池、exact / semantic cache、Provider Cache 布局和智能路由,并保留 Trace 审计。
Account Capabilities
个人账号与企业账号拥有清晰、可验证的 Access Token、用户自有商业 API Key 绑定额度和压缩模式边界;登录后系统只显示并允许使用该账号可用的模式。
面向个人开发、独立创作与单人商业 API 工作流。
面向团队、多项目、企业 RAG 与统一商业 API 治理。
商业 API Key 需由用户自行向对应供应商申请、购买或取得授权;上述数字仅表示每个商业 API 可绑定到 GistToken 的用户自有 Key 数量,不包含平台赠送的商业 API Key。
保真压缩、智能结构化 / 强力压缩、关键句提取
平衡压缩、代码结构压缩、模型感知、会话状态、可逆无损封装(仅内部/SDK)
RAG 证据
70%+
企业高重复场景组合节省
90%
provider cache 理想命中折扣
8+
可定制商业模型供应商
Core
私有池 + Cache Fabric 架构
低成本模型选择、会话压缩、文件上传和 OpenAI-compatible API。
多模型切换、访问 Token、成本看板、节省模式和 SDK 接入。
租户私有池、缓存复用、审计追踪、私有化部署与成本治理。