⚙️
How It Works
工作原理 · 了解 StarNexus Integrity 的技术实现
检测流程
StarNexus Integrity 通过以下步骤完成论文检测:
1
论文解析
AI 自动识别论文结构(标题、摘要、正文、参考文献等),提取文本内容用于分析
2
文本预处理
对文本进行分词、去停用词、归一化等处理,为后续比对和分析做准备
3
相似度比对
与数十亿篇已发表文献进行语义相似度比对,识别可能的抄袭内容
4
AI 内容检测
使用专门训练的模型识别 AI 生成的文本特征,区分人机协同写作内容
5
引用核验
验证参考文献的真实性、准确性和格式规范性,与多个数据库交叉验证
6
报告生成
综合各项检测结果,生成详细的检测报告,包含问题标注和修改建议
技术架构
检测流水线架构
论文上传
→
文本解析
→
AI 分析
→
比对核验
→
报告输出
核心 AI 模型
- Transformer-based 文本分析
- 语义理解与比对
- AI 生成内容识别
- 多语言支持
数据处理
- 分布式向量检索
- 实时索引更新
- 大规模数据比对
- 隐私保护处理
外部数据接入
- Crossref API
- Semantic Scholar API
- OpenAlex API
- 自定义数据库
算法原理
相似度检测算法
我们采用多种算法组合实现精准的相似度检测:
- BM25:基于词频的传统信息检索算法,快速定位相似文献
- SBERT:基于句子嵌入的语义相似度计算,捕捉深层语义相似性
- SimHash:近似文本检测算法,高效识别改写/重写内容
- Cross-Encoder:精细的两两比对模型,用于高风险内容的深度分析
AI 内容检测
针对 AI 生成内容,我们采用专门的检测策略:
- 分析文本的困惑度(Perplexity)特征
- 检测词汇分布的统计特征
- 识别常见的 AI 写作模式
- 综合多种特征进行分类判定
引用核验
引用核验基于多源数据交叉验证:
- 从文本中自动提取引用信息
- 调用多个文献数据库 API 进行验证
- 比对元数据(标题、作者、期刊、年份等)
- 生成可信度评级
准确率说明
我们的检测系统持续优化,各项检测指标如下:
- 查重准确率:99%(针对已发表文献)
- AI 检测准确率:95%(针对主流 AI 模型生成内容)
- 引用核验准确率:98%(针对 Crossref 收录文献)
- 误报率:低于 3%(持续优化中)
* 检测结果仅供参考,最终判断应由作者或编辑结合专业知识做出。