Edit Models filters
Model Tree
Apps
Inference Providers
One-click Deployment
Models
49
Active filters: audio-visual
bpiyush/sound-of-water-models
Audio Classification • Updated • 3
bolinlai/CSTS
Updated • 11
openinterx/UGC-VideoCaptioner
Video-Text-to-Text • 6B • Updated • 934 • 4
JusperLee/Dolphin
Audio-to-Audio • 7.04M • Updated • 721 • 16
Memories-ai/UGC-VideoCaptioner
Video-Text-to-Text • 6B • Updated • 8 • 2
matbee/sam-audio-small-onnx
Updated • 9
matbee/sam-audio-large-onnx
Updated • 8
square-zero-labs/sam-audio-small-onnx
Updated
lopho/ltx2-artist-loras
Updated • 3
dnamodel/tsam-viewer-emotions
Video Classification • Updated • 7
oonepieceeyewear/UGC-VideoCaptioner
Video-Text-to-Text • 6B • Updated • 11
nvidia/nemotron-labs-audio-visual-flamingo-hf
Video-Text-to-Text • 9B • Updated • 608 • 12
ckoutlis/auvire-lavdf
12.1M • Updated • 7 • 1
ckoutlis/auvire-avdeepfake1m
8.93M • Updated • 10
Vegetabot/AVSQwen-Omni-7B
Image-Text-to-Text • 11B • Updated • 8
Vegetabot/AVSQwen-Omni-3B
Image-Text-to-Text • 6B • Updated • 13
vsro200/models-vsro200
Video-Text-to-Text • Updated
mhussainahmad/averformer-ravdess
Updated • 3
mhussainahmad/averformer-cremad-v4
Updated • 2
mhussainahmad/averformer-ravdess-v4
Updated • 10
mhussainahmad/averformer-meld-v4
Updated • 4
michaelrhs/mr-big-eye-orch-v2
Visual Question Answering • Updated • 6
NJU-LINK/OmniCaptioner-IF-7B
Image-Text-to-Text • 11B • Updated • 7
NJU-LINK/OmniCaptioner-IF-3B
Image-Text-to-Text • 6B • Updated • 4
NiDeYingZiD/BHGap-ckpt
Updated
catnip-ai-tech/MaineCoon
Any-to-Any • Updated • 29
JusperLee/Real-World-AVSE-Baseline-Track1
Audio-to-Audio • 25M • Updated • 1
JusperLee/Real-World-AVSE-Baseline-Track2
Audio-to-Audio • 25M • Updated • 2
vl4gh7/dslp-ensemble
Updated • 2