说明文档
🧠 IntextIQ:内文智能 —— 智能查找关键信息
📖 概述
IntextIQ 是一个智能 token 提取和记忆增强推理框架,旨在增强大语言模型(LLMs)在长上下文对话场景中的表现。
该系统从用户输入中识别并保留语义上重要的 token,高效存储,并通过**检索增强生成(RAG)**管道进行检索,以提升上下文理解和事实一致性。
这种方法使 LLM 能够"记住关键内容"——即使在长时间交互中也能保持连贯、准确且具备上下文感知的对话。
🚀 核心特性
-
Token 级语义提取
使用在对话数据上微调的 DistilBERT 模型提取有意义的 token,数据由 Mistral-22B 和 GPT-OSS-20B 生成。 -
记忆增强 RAG 集成
将 token 检索与 RAG 框架无缝集成,为 LLM 提供显式的上下文记忆。 -
Groq LLM 集成
结合 Groq 的高速推理与 IntextIQ 的语义记忆,生成更具事实性和上下文相关性的响应。 -
BIO 标签进行 Token 标注
实现 BIO(Begin–Inside–Outside)标签,用于文本序列的精确语义分割。 -
交互式 Gradio 界面
用户友好的界面,用于输入文本、查看提取的 token 并可视化基于 RAG 的响应生成。
🧩 系统架构
整体架构由六个主要组件组成:
- 输入消息 – 原始用户输入。
- IntextIQ 模型(Token 提取器) – 使用微调的 DistilBERT 提取关键 token。
- 嵌入模型 – 将 token 转换为高维语义向量。
- RAG 系统 – 从记忆或外部数据源检索相关上下文。
- LLM – 使用增强的上下文生成改进的输出。
- 输出层 – 返回事实可靠且上下文连贯的响应。
⚙️ 技术栈
| 组件 | 技术 |
|---|---|
| Token 提取 | DistilBERT(微调) |
| 数据生成 | Mistral-22B, GPT-OSS-20B |
| 嵌入 | Safetensors |
| 集成 | 检索增强生成(RAG) |
| 前端 | Gradio |
| LLM 引擎 | OLLAMA |
| 环境 | Python 3.10+, PyTorch, Transformers, FAISS |
📊 数据集信息
使用代表普通人机对话的合成对话数据生成了两个数据集:
| 数据集 | 模型 | 行数 | 生成时间 | 质量 |
|---|---|---|---|---|
| Dataset-1 | Mistral-22B | 5,000 | 24.5 小时 | 中等 |
| Dataset-2 | GPT-OSS-20B | 10,000 | 50 小时 | 高(97% 可用) |
由于更好的数据质量和上下文多样性,第二个数据集被用于微调。
🧠 模型工作流程
- 预处理
文本清洗、规范化和 BIO 标签。 - Token 提取
微调的 DistilBERT 识别重要的 token。 - 嵌入生成
每个 token 被转换为 Safetensor 嵌入向量。 - RAG 集成
检索到的 token 嵌入在响应生成期间提供给 Groq LLM。 - 响应生成
LLM 生成增强的、上下文可靠的答案。 - 可视化
Gradio 界面显示提取的 token 和 RAG 输出。
🧪 评估指标
| 指标 | Groq(基线) | IntextIQ(提出方法) | 提升 |
|---|---|---|---|
| 上下文相关性(%) | 72.3 | 91.4 | +26.4% |
| 事实一致性(%) | 68.1 | 89.7 | +21.6% |
| 语义连贯性(ROUGE-L) | 0.61 | 0.79 | +13% |
| 幻觉率(%) | 17.8 | 5.9 | ↓66% |
主要结果:
IntextIQ 在事实可靠性和上下文连续性方面取得了显著提升,验证了 token 级检索在基于 RAG 的对话系统中的有效性。
🔍 性能总结
- 26.4% 的上下文相关性提升
- 21.6% 的事实一致性提升
- 13% 的语义连贯性提升(ROUGE-L)
- 66% 的幻觉率降低
这些指标验证了语义压缩和检索方法能够提升 LLM 在长时间对话中的准确性、连贯性和上下文推理能力。
📈 未来扩展
- 引入 RLHF(人类反馈强化学习) 进行自适应 token 加权。
- 将记忆扩展为持久化多会话知识图谱。
- 开发领域特定变体(如法律、教育、医疗)。
- 探索多模态 token 提取,支持图像和语音数据。
- 使用量化或蒸馏部署优化版本,用于边缘推理。
madhavgohel/bert-token-onnx
作者 madhavgohel
创建时间: 2025-08-01 19:31:34+00:00
更新时间: 2025-12-03 11:22:27+00:00
在 Hugging Face 上查看