Skip to content
View HuggingNobody's full-sized avatar
  • NCC
  • Guangzhou

Block or report HuggingNobody

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
HuggingNobody/README.md

You Tao

音频 · 视频多模态大模型研究者 · Audio-Visual Foundation Models
从声音表示学习出发,一路走到把音视频编码器接入大语言模型

Research Focus Approach


关于我

我是一名长期从事音频与视频多模态大模型(audio-visual foundation models)研究的工程研究者。 硕士到博士一直深耕视听(audio-visual)方向——从声音表示学习起步,逐步走向 音视频跨模态对齐视听语音理解,直至把音频 / 视频编码器接入大语言模型

我偏好可复现、离线优先的开源研究。下面每个项目都遵循同一套取舍:参考算法以 纯 NumPy 核心实现,import 时不拉入任何深度学习框架,无 GPU、甚至无网络也能 完整跑通与单测;需要真正训练神经网络时,再按需启用可选的 PyTorch 后端。这样既方便 在普通机器上做原型与教学,也保留了通往真实训练的通道。

一条研究主线

 声音表示学习   ──▶   音视频跨模态对齐   ──▶   视听语音理解   ──▶   接入大语言模型
  sonobase             avalign               avhark              avlingua
  自监督音频基座        对齐 / 同步 / 检索      唇音融合 · AV-ASR     编码器 → 投影器 → LLM

四个仓库不是彼此孤立的 demo,而是沿着上面这条主线逐级搭起来的:先给「音频侧」做一个 干净的自监督基座,再把音频与视觉对齐到同一个嵌入空间,接着在噪声场景下把两种模态融合 去理解语音,最后把这些编码器接进 LLM 完成生成式的视听理解。

精选项目

以下均为本账号自己维护的原创仓库(非 fork),每个都配有 CI、类型检查、文档与可运行示例。

项目 简介 关键词
sonobase 自监督音频表示学习工具包:掩码谱图重建(MAE)与对比学习(NT-Xent)预训练,作为视听研究的音频基座;MAE 与对比两条路线共用同一个 SpectrogramTransformer 编码器,预训练后可直接做线性探针 自监督 · MAE · 对比学习
avalign 音视频跨模态对齐与检索框架:用 InfoNCE / CLIP 对称损失把音频与视觉编码器对齐到同一嵌入空间,配套基于归一化互相关的同步偏移估计,以及双向 Top-K 跨模态检索(Recall@K / mAP) 对比对齐 · 音视频同步 · 跨模态检索
avhark 面向噪声场景的视听语音理解框架:SNR 自适应门控融合唇动与音频——安静时多信任音频、嘈杂时多信任唇动——做鲁棒 AV-ASR(CTC 贪心 / beam)、说话人分离与声学事件理解(WER / CER / DER 评测) AV-ASR · 说话人分离 · 噪声鲁棒
avlingua 把预训练音视频编码器(Whisper / BEATs · CLIP-ViT / VideoMAE)经可插拔投影器(线性 / MLP / Q-Former)接入 LLM 词嵌入空间,统一视听问答、视频描述与多模态指令跟随;内置确定性 mock 后端,零权重即可跑通全链路 多模态 LLM · 投影器 · 视听问答

研究兴趣

  • 音频表示学习 —— 自监督预训练(掩码重建、对比学习)、谱图特征、可迁移的音频骨干
  • 跨模态对齐 —— 音频 ↔ 视觉的对比对齐、音视频同步、跨模态检索
  • 视听语音理解 —— 唇音融合、噪声鲁棒的 AV-ASR、说话人分离与声学事件理解
  • 多模态大模型 —— 编码器到 LLM 的投影 / 适配、模态 token 的提示词组装、生成式视听理解

技术取向

Python NumPy PyTorch Reproducible License

  • NumPy 优先的核心:算法参考实现零重依赖,便于阅读、替换与逐模块单测。
  • PyTorch 只在需要时出现:深度编码器与训练循环放在可选 [torch] extra,惰性加载。
  • 诚实基线:手写通路让每个深度组件的收益都能与可复现的基线对照,而非一味刷分。
  • 完整工程化:每个仓库都配有 CI(部分含 CodeQL)、类型检查、文档(架构 / 用法 / 设计笔记 / API)与可运行示例。

正在做的事

把上面四条线索继续往「统一的视听 + 语言」方向收拢——让同一套编码器 → 投影器 → LLM 的链路 既能听懂噪声中的语音,也能看懂画面并用自然语言作答,同时始终守住可复现、离线可跑的底线。

Built for reproducible, offline-first audio-visual research.

Pinned Loading

  1. avalign avalign Public

    Audio-visual cross-modal contrastive alignment, synchronization and retrieval — NumPy core with an optional PyTorch backend

    Python 1

  2. avhark avhark Public

    面向噪声场景的视听语音理解框架:唇音融合 AV-ASR、说话人分离与声学事件理解(纯 NumPy 核心,可选 PyTorch)

    Python 1

  3. avlingua avlingua Public

    把预训练音视频编码器接入大语言模型的多模态框架:视听问答、视频描述与多模态指令跟随(纯 NumPy 核心,可选 PyTorch)

    Python 1

  4. sonobase sonobase Public

    Self-supervised audio representation learning: masked-spectrogram (MAE) and contrastive pretraining, a NumPy-first audio backbone.

    Python 1

  5. sapientinc/HRM-Text sapientinc/HRM-Text Public

    HRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.

    Python 1.8k 167

  6. ZhangJinHaHaHa/AgentLens ZhangJinHaHaHa/AgentLens Public

    Agentlens is a trusted agent trading platform. Here, you can quickly find the Agent that meets your needs, and you can also publish your own Agent to turn it into your digital asset. We encourage e…

    TypeScript 1k 61