EMNLP 2026 · Under Review
面向 SQL 等价验证训练可本地部署的轻量推理模型,通过形式化监督与可验证奖励学习 SQL 等价 / 不等价的决策边界。
🧩 问题
执行测试只能说明两条 SQL 在有限数据库实例上结果一致,无法证明语义等价;VeriEQL 等形式化验证器面对复杂嵌套、聚合和关系组合时又容易超时,而直接使用通用大模型成本较高且判断稳定性不足。
⚙️ 方法
构建 LeetCode 人工多解 + SynSQL 合成数据双轨训练集,利用 VeriEQL 生成形式化标签,并蒸馏与标签一致的验证式推理轨迹;采用 SFT Warm-up + GRPO 可验证奖励训练 Qwen2.5 / Qwen3 小模型。
📈 结果
Qwen2.5-Coder-1.5B 在 LeetCode-Hard 上的 GM 从全量 SFT 的 73.60 提升至 89.38,整体 AVG 达 83.08。
60K CoRE-SQL · Qwen2.5-Coder-1.5B · SFT · GRPO · VeriEQL
EMNLP 2026 · Under Review · arXiv · 代码
在相同自然语言问题、Schema 和数据内容下构建多数据库方言评测环境,用于直接衡量 Text-to-SQL 模型的跨方言泛化能力。
🧩 问题
现有 Text-to-SQL 基准长期集中于 SQLite,不同数据库在类型系统、函数、标识符规则和执行语义上存在明显差异,难以评估模型在真实异构数据库中的泛化能力。
⚙️ 方法
基于 BIRD Dev 的 1,534 个问题构建 16 种 SQL 方言。SQL 转换采用 SQLGlot 规则翻译 + LLM Retry + Rule Base 的混合流程,并结合执行反馈持续修复,跨方言 SQL 转换通过率达到 95%+。
同时完成 MySQL、PostgreSQL、Oracle、Hive 等多数据库环境搭建、数据迁移、类型映射和执行一致性核验,并实现跨数据库 EX 自动化评测流程。
📈 结果
最终形成 24,544 条人审可执行 SQL,支持多模型在不同 SQL 方言下统一推理、执行和结果对比,为 Text-to-SQL 跨数据库泛化评测提供可复现基准。
1,534 Questions · 16 SQL Dialects · 24,544 Executable SQL · 95%+ Translation Pass
NDBC 2026 · Accepted
将形式化验证与任务适配的小模型进行分层协同,在保留形式化确定结论的同时补全复杂 SQL 场景下的验证覆盖。
🧩 问题
VeriEQL 的 equivalent / inequivalent 结论具有形式化依据,但复杂 SQL 上可能出现 timeout、unsupported、runtime error、conversion error 等非确定状态;直接使用本地模型虽然覆盖率更高,却会丢失形式化结论与模型判断之间的可信边界。
⚙️ 方法
基于历史 VeriEQL 日志建立验证收益画像,并根据 SQL 结构动态分配验证预算;优先保留形式化验证器的确定输出,仅将非确定状态路由到任务适配的本地 SFT 模型,并结合 Self-Consistency 提高判断稳定性。
📈 结果
在 Calcite + Spider-DAIL 域外数据上达到 83.98 GM,显著优于固定预算 VeriEQL 与纯 SFT 模型,同时将未决率降低至 0%。
VeriEQL · Failure-Aware Routing · Local SFT Model · 83.98 OOD GM
算法研发实习生 · 2026.04 — 2026.06
参与工业视觉模型自动优化 Agent 研发,覆盖检测、分类、属性识别、分割等任务,并适配 YOLO、MMPretrain、MMDetection 等训练后端。
参与多智能体优化流程设计,将实验规划、数据分析、结构调整、超参搜索和结果复盘组织为协同模块;构建远端训练、状态监控、异常诊断、指标回填和候选模型管理能力。
Multi-Agent · ClearML · Human-in-the-loop · Safe Code Editing
暑期实习生 · 优秀实习生 · 2026.07 — 2026.08
围绕涉农金融多源业务数据,设计 Customer—Cycle—Event—Evidence 数据组织方式,将客户、经营周期、经营事件和原始证据统一关联。
构建 Rule Engine + RAG + Multi-Agent + Human-in-the-loop 协同链路,分别处理确定性指标计算、制度与合同检索、经营分析、订单核对、风险事项整理和人工复核。
同时设计 RBAC 权限控制、Audit Log,以及模型、Prompt 和知识库版本追踪机制,使关键计算、检索依据和人工修正过程可核验、可回溯。
Rule Engine · RAG · Multi-Agent · HITL · RBAC · Audit Log
面向多账号 ChatGPT / Codex 使用场景的远程会话中继系统
电脑端可能同时维护多个 ChatGPT / Codex 账号。离开电脑后,如果直接在手机端继续任务,不仅需要手机保持 VPN 环境,还需要重新登录对应账号;当前账号额度用完后,又需要反复退出、登录和切换账号。
RelayDesk 将电脑端已经登录并运行的 Codex / Claude Code 会话直接延伸到手机浏览器:
账号、VPN 和执行环境留在电脑端,手机只负责远程交互。
因此手机端:
✅ 无需 VPN
✅ 无需登录 ChatGPT 账号
✅ 无需反复切换多个账号
✅ 可以直接复用电脑端已有开发环境和会话上下文
主要功能:
- 📂 按项目浏览电脑端历史会话,并在原上下文中继续任务
- 🎛️ 远程调整模型、思考强度和工作区权限
- ⚡ 实时同步模型回复、工具调用和执行状态
- 🔐 电脑端服务仅监听
127.0.0.1 - 🛡️ 会话内容端到端加密,中继服务器仅负责转发密文
- 🔑 使用 16 位配对码完成新设备绑定,并由电脑端确认
🚀 在线使用 → relay.xingshihao.site
💻 GitHub → RelayDesk
面向企业贷款授信审查的多 Agent 辅助工作台,覆盖材料盘点、财务指标计算、经营与还款来源分析、风险汇总、证据引用和报告自审计。
Multi-Agent · RAG · Evidence Tracking · Human-in-the-loop
常驻桌面角落的跨平台待办小组件,支持分钟级截止时间、DDL 进度、重要度、收藏和系统托盘操作。
React · TypeScript · Tauri
透明、置顶、可缩放的桌面背词窗口,将编译等待和碎片时间转化为低干扰学习。
React · Zustand · Tauri
软件学院 · 网络与信息安全 · 硕士研究生
2024.09 — 2027.06
信息科学与工程学院 · 计算机科学与技术 · 本科
2020.09 — 2024.06
🥈 第十六届全国大学生金融科技创新大赛全国二等奖
河南省第一名
🥈 “互联网+”河南省赛银奖
🥉 “挑战杯”河南省赛铜奖
🤖 人工智能创新创业大赛一等奖
💡 河南大学大学生创新大赛三等奖
🏅 一等奖学业奖学金 × 2
🗣️ 第六届创新英语挑战赛二等奖
📘 CET-4
🏸 河大杯羽毛球比赛第六名
💻 大学生计算机设计大赛优秀志愿者

