COMPUTER SCIENCE · RELIABLE AI · 2026
I'm Zhiyuan.
I build reliable AI systems, and keep the evidence.
计算机科学与技术硕士研究生。我的兴趣落在大模型应用、可靠性验证与 Agent 工作流的交界处:让模型做事,也让结果可追溯、可复现、可质疑。
01 / ABOUT
我关心模型能做什么,
更关心我们凭什么相信它。
我的工作从应用出发,最终总会回到一个底层问题:一个看似聪明的输出,怎样变成可以被检查、复现和继续使用的知识。于是我在 RAG、语义几何、解释反馈和 Agent 合同之间搭桥。
我把研究和工程看作同一条河的两岸。研究提出可被证伪的问题,工程把问题变成真实约束;持续写作则保存每次选择背后的理由。
02 / RESEARCH LENS
从输出到证据,
从模型到系统。
三条反复出现的线索,构成了我做研究和产品时的判断坐标。
语义可靠性
用检索证据、语义空间和几何一致性识别模型的低置信输出,让“正确”拥有可解释的支点。
反馈式建模
让解释信号进入生成与搜索循环,使特征、模型和提示词在证据约束下共同演化。
可审计 Agent
把目标、权限、证据和验收写进工作流合同,让自主执行仍然保留边界与责任链。
AutoEDM
LLM 驱动自动特征工程与模型搜索;以 SHAP 反馈环把解释信号送回特征演化过程。
研究代码暂未公开SE-SPP / SemFaith
用语义几何与检索证据校验模型预测和推理链的一致性,关注低置信输出的识别。
研究代码暂未公开Evidence-Gated Harness
面向数据科学 Agent 的合同驱动执行框架,把提交、验证、证据与安全边界变成显式协议。
私有仓库,整理后公开ToolMigrate
研究工具迁移与运行时安全边界,让 Agent 的能力移动仍保留验证路径。
私有仓库,整理后公开03 / INTERACTIVE PROOFS
Try the work, don’t just read it.
三个一分钟内能看懂的交互切片。它们不伪装成完整产品,只把每个项目真正解决的困难摆到桌面上。
模型给了一个听起来合理的结论,但证据链还不够完整。
PROTOTYPE
“这组实验足以支持方法稳定优于基线。”
03 / SELECTED WORK
Ideas become
working systems.
自有公开项目优先连接在线体验;研究中的私有工作只呈现问题与方向,不展示未经公开的实现。
ScholarFlow
本地优先的科研规划助手,把课题拆成证据、实验、主张与交付合同;DeepSeek 负责规划,Codex 负责可审计执行。
建立证据门控、阶段合同与本地记忆边界,并提供纯前端与完整模式两种运行形态。
论文主张审计
ScholarFlow
解决的具体时刻
研究计划里写下了“方法稳定优于基线”,但原始主张没有绑定实验和反例。
“方法稳定优于基线”
AFTER把一句听起来可信的话,变成可定位、可复现、可质疑的研究任务。
Chronicle Memory
面向个人手账、口述史、传记与日志的证据优先记忆基础设施,区分事实、推断与叙事。
设计可追溯记忆模型、真实性边界与可审计的资料编排流程,并提供可实际登录使用的云端版本。
实验口述记忆
Chronicle Memory
解决的具体时刻
“今天结果好像更好”同时混杂事实、推测和下一步,数周后已经无法追溯。
“今天结果好像更好,明天再跑一次。”
AFTER同一条记录同时保留叙事温度与证据边界,回看时知道哪些能相信。
Let Code in Pad
面向 PC 深度录入与平板碎片复习的离线知识工具,管理算法、面试、文章与隔离日记空间。
设计平行空间、Markdown 混合编辑、GitHub 同步与纯前端离线导出。
跨设备算法复习
Let Code in Pad
解决的具体时刻
电脑适合完整作答,平板适合碎片复习,但普通笔记工具无法保存可反复遮蔽的答案。
复习卡:最长回文子串的状态转移?
AFTER同一份 Markdown 在不同设备切换工作形态,离线时仍能完整使用。
Aiznoyer Atlas
把本科笔记、研究生写作、算法练习与多仓库数据源统一为可搜索、可连接、可扩展的知识系统。
内容与框架解耦,统一文档模型,加入算法工作台、知识图谱与浏览器端 AI 协作。
十年知识迁移
Aiznoyer Atlas
解决的具体时刻
本科笔记、研究生博客和算法仓库结构不同,搜索只能找到文件,找不到知识路径。
从一份笔记出发,试着选择下一跳。
文档协议 → 找到可继续阅读的关联路径
AFTER107 篇历史内容成为一个可搜索、可浏览、可继续扩展的知识系统。
What To Eat Tonight
把选择困难做成可配置的饭店转轮,并封装为 Android 端轻量体验。
完成交互、候选管理、动画反馈与移动端封装。
晚餐选择实验
What To Eat Tonight
解决的具体时刻
“吃什么”没有最优解,真正的困难是候选太多且每次讨论成本很高。
AFTER把反复争论压缩成十秒钟的共同小游戏,让决定本身变得轻松。
AI Podcast
将选题、内容生成、文本润色与语音合成组织成可扩展的 LangGraph 流程。
拆分工作节点与状态流,支持本地模型和在线模型的可替换配置。
播客生成流水线
AI Podcast
解决的具体时刻
选题、写稿、润色和语音合成彼此耦合,任一步失败都需要从头重来。
点击推进一段可恢复的创作流水线。
AFTER每个创作阶段都成为可替换、可观察、可单独重跑的 Agent 节点。
UPSTREAM INDEX
开源项目中的真实贡献
区分等待评审与已经合并的工作,用 PR 记录说明贡献发生在哪里。
在 fork 上新增 Android uiautomator2 版本与 Android 操作手册,共 2 个领先提交。
upstream contribution查看项目 ↗提交 OneBot v11 / NapCat QQ 适配与 SQLite、内存后端 nullable resource_id 修复;代码已提交上游,当前尚未合并。
2 PRs · awaiting review查看 PR ↗为自定义模型提供商加入 Ollama 与 OpenAI-compatible 本地模型适配,覆盖配置、运行链路与界面,已被上游合并。
PR #6 · merged查看 PR ↗04 / JOURNEY
把经历写成
一条因果链。
计算机科学与技术 · 硕士
湖南科技大学聚焦大模型可靠性、语义检索、自动特征工程与证据约束的 Agent 系统。
大模型应用开发实习生
立得空间信息技术股份有限公司参与垂域模型评估、LoRA 适配、RAG 与工具调用链路,服务无人物流车语音控制场景。
数据科学与大数据技术 · 本科
湖南科技大学从算法、大数据系统与工程实践出发,形成持续写作和可复用知识管理习惯。
05 / LET'S CONNECT
Build something
worth trusting.
如果你也在做可靠的大模型应用、可审计 Agent 或知识基础设施,我们可以从一个具体问题开始聊。