T2V-CompBench
[CVPR 2025] T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation
파일 탐색기
최종 버전 다운로드 (.zip)- ranking.png
- teaser.png
- davis_dolphins.mp4
- davis_rollercoaster.mp4
- davis_seasnake.mp4
- demo1_midas.mp4
- demo1_ours.mp4
- demo1_video.mp4
- demo2_midas.mp4
- demo2_ours.mp4
- demo2_video.mp4
- controlnet_demo1.png
- controlnet_demo2.png
- paper.pdf
- teaser.png
- config.json
- README.md
- transform.py
- blocks.py
- dpt.py
- kitti_eigen_test_files_with_gt.txt
- kitti_eigen_train_files_with_gt.txt
- nyudepthv2_test_files_with_gt.txt
- nyudepthv2_train_files_with_gt.txt
- __init__.py
- data_mono.py
- ddad.py
- diml_indoor_test.py
- diml_outdoor_test.py
- diode.py
- hypersim.py
- ibims.py
- preprocess.py
- sun_rgbd_loader.py
- transforms.py
- vkitti.py
- vkitti2.py
- blocks.py
- dpt.py
- __init__.py
- depth_anything.py
- midas.py
- attractor.py
- dist_layers.py
- localbins_layers.py
- patch_transformer.py
- __init__.py
- config_zoedepth.json
- config_zoedepth_kitti.json
- zoedepth_v1.py
- __init__.py
- config_zoedepth_nk.json
- zoedepth_nk_v1.py
- __init__.py
- builder.py
- depth_model.py
- model_io.py
- base_trainer.py
- builder.py
- loss.py
- zoedepth_nk_trainer.py
- zoedepth_trainer.py
- __init__.py
- __init__.py
- arg_utils.py
- config.py
- geometry.py
- misc.py
- depth_to_pointcloud.py
- environment.yml
- evaluate.py
- README.md
- train_mix.py
- train_mono.py
- depth_anything_large_mask2former_16xb1_160k_ade20k_896x896.py
- depth_anything_large_mask2former_16xb1_80k_cityscapes_896x896.py
- depth_anything_large_mask2former_16xb1_80k_cityscapes_896x896_ms.py
- dinov2.py
- README.md
- hubconf.cpython-312.pyc
- vision_transformer.cpython-312.pyc
- __init__.cpython-312.pyc
- vitb14_pretrain.yaml
- vitg14_pretrain.yaml
- vitl14_pretrain.yaml
- vits14_pretrain.yaml
- vitg14.yaml
- vitl14.yaml
- vitl16_short.yaml
- __init__.py
- ssl_default_config.yaml
- __init__.py
- decoders.py
- extended.py
- image_net.py
- image_net_22k.py
- __init__.py
- adapters.py
- augmentations.py
- collate.py
- loaders.py
- masking.py
- samplers.py
- transforms.py
- __init__.py
- __init__.py
- knn.py
- linear.py
- log_regression.py
- metrics.py
- setup.py
- utils.py
- __init__.py
- __init__.cpython-312.pyc
- attention.cpython-312.pyc
- block.cpython-312.pyc
- dino_head.cpython-312.pyc
- drop_path.cpython-312.pyc
- layer_scale.cpython-312.pyc
- mlp.cpython-312.pyc
- patch_embed.cpython-312.pyc
- swiglu_ffn.cpython-312.pyc
- __init__.py
- attention.py
- block.py
- dino_head.py
- drop_path.py
- layer_scale.py
- mlp.py
- patch_embed.py
- swiglu_ffn.py
- __init__.py
- helpers.py
- __init__.py
- dino_clstoken_loss.py
- ibot_patch_loss.py
- koleo_loss.py
- __init__.py
- vision_transformer.py
- knn.py
- linear.py
- log_regression.py
- train.py
- __init__.py
- submit.py
- __init__.py
- ssl_meta_arch.py
- train.py
- __init__.py
- cluster.py
- config.py
- dtype.py
- param_groups.py
- utils.py
- __init__.py
- lint.sh
- CODE_OF_CONDUCT.md
- conda.yaml
- CONTRIBUTING.md
- hubconf.py
- LICENSE
- MODEL_CARD.md
- pyproject.toml
- README.md
- requirements-dev.txt
- requirements.txt
- setup.cfg
- setup.py
- utils.py
- vision_transformer.py
- README.md
- app.py
- compbench_run_depth.py
- gallery.md
- LICENSE
- README.md
- requirements.txt
- run.py
- run_video.py
- teaser.gif
- bootstapir.json
- cotracker2_patch_4_wind_8.json
- cotracker3_wind_60.json
- cotracker_patch_4_wind_8.json
- raft_patch_4_alpha.json
- raft_patch_8.json
- tapir.json
- cvo_dataset.py
- movi_f_dataset.py
- movi_f_tf_dataset.py
- tap_dataset.py
- __init__.py
- blocks.py
- cotracker.py
- losses.py
- __init__.py
- embeddings.py
- model_utils.py
- __init__.py
- build_cotracker.py
- evaluation_predictor.py
- __init__.py
- visualizer.py
- LICENSE.md
- predictor.py
- __init__.py
- blocks.py
- cotracker.py
- cotracker3_offline.py
- cotracker3_online.py
- losses.py
- __init__.py
- embeddings.py
- model_utils.py
- __init__.py
- build_cotracker.py
- evaluation_predictor.py
- __init__.py
- visualizer.py
- LICENSE.md
- predictor.py
- __init__.py
- blocks.py
- cotracker.py
- losses.py
- __init__.py
- embeddings.py
- model_utils.py
- __init__.py
- build_cotracker.py
- evaluation_predictor.py
- __init__.py
- visualizer.py
- LICENSE.md
- predictor.py
- __init__.py
- corr.py
- extractor.py
- LICENSE
- update.py
- utils.py
- LICENSE
- nets.py
- tapir_model.py
- utils.py
- __init__.py
- cotracker.py
- cotracker2.py
- cotracker3.py
- raft.py
- tapir.py
- __init__.py
- dense_optical_tracking.py
- interpolation.py
- optical_flow.py
- point_tracking.py
- __init__.py
- cvo_metrics.py
- tap_metrics.py
- base_options.py
- compbench_demo_options.py
- demo_options.py
- preprocess_options.py
- test_cvo_options.py
- test_tap_options.py
- train_options.py
- knn.cu
- knn.h
- knn_cpu.cpp
- packed_to_padded_tensor.cu
- packed_to_padded_tensor.h
- packed_to_padded_tensor_cpu.cpp
- dispatch.cuh
- float_math.cuh
- geometry_utils.cuh
- geometry_utils.h
- index_utils.cuh
- mink.cuh
- pytorch3d_cutils.h
- vec2.h
- vec3.h
- warp_reduce.cuh
- ext.cpp
- __init__.py
- knn.py
- LICENSE
- packed_to_padded.py
- setup.py
- utils.py
- __init__.py
- io.py
- log.py
- plot.py
- torch.py
- __init__.py
- compbench_eval_motion_binding.py
- demo.py
- LICENSE
- preprocess.py
- README.md
- requirements.txt
- test_cvo.py
- test_tap.py
- train.py
- annotated_image.jpg
- automatic_label_output_demo3.jpg
- chatbot_demo.png
- demo1.jpg
- demo2.jpg
- demo3.jpg
- demo4.jpg
- demo5.jpg
- demo6.jpg
- demo7.jpg
- demo8.jpg
- demo9.jpg
- gradio_auto_label.png
- gradio_demo.png
- Grounded-SAM_logo.png
- grounded_sam2.png
- grounded_sam_annotated_image.jpg
- grounded_sam_demo3_demo4.png
- grounded_sam_inpainting_demo.png
- grounded_sam_new_demo_image.png
- grounded_sam_output_demo1.jpg
- grounded_sam_whisper_output.jpg
- grounding_dino_output_demo1.jpg
- groundingdino_annotated_image.jpg
- inpaint_demo.jpg
- mask_3dbox.png
- n015-2018-08-02-17-16-37+0800__CAM_BACK_LEFT__1533201470447423.jpg
- ram_grounded_sam_new.png
- common.py
- rep_vit.py
- setup_edge_sam.py
- tools.py
- example_light_hqsam.png
- grounded_light_hqsam_annotated_image.jpg
- setup_light_hqsam.py
- tiny_vit_sam.py
- setup_mobile_sam.py
- tiny_vit_sam.py
- repvit.py
- setup_repvit_sam.py
- grounded_edge_sam.py
- grounded_efficient_sam.py
- grounded_fast_sam.py
- grounded_light_hqsam.py
- grounded_mobile_sam.py
- grounded_repvit_sam.py
- README.md
- compbench_eval_numeracy.py
- gradio_app.py
- inference_on_a_image.py
- GroundingDINO_SwinB.py
- GroundingDINO_SwinT_OGC.py
- __init__.py
- transforms.py
- __init__.py
- backbone.py
- position_encoding.py
- swin_transformer.py
- ms_deform_attn.h
- ms_deform_attn_cpu.cpp
- ms_deform_attn_cpu.h
- ms_deform_attn_cuda.cu
- ms_deform_attn_cuda.h
- ms_deform_im2col_cuda.cuh
- cuda_version.cu
- vision.cpp
- __init__.py
- bertwarper.py
- fuse_modules.py
- groundingdino.py
- ms_deform_attn.py
- transformer.py
- transformer_vanilla.py
- utils.py
- __init__.py
- registry.py
- __init__.cpython-310.pyc
- __init__.cpython-312.pyc
- box_ops.cpython-310.pyc
- get_tokenlizer.cpython-310.pyc
- misc.cpython-310.pyc
- slconfig.cpython-310.pyc
- slconfig.cpython-312.pyc
- utils.cpython-310.pyc
- utils.cpython-312.pyc
- visualizer.cpython-310.pyc
- vl_utils.cpython-310.pyc
- __init__.py
- box_ops.py
- get_tokenlizer.py
- inference.py
- logger.py
- misc.py
- slconfig.py
- slio.py
- time_counter.py
- utils.py
- visualizer.py
- vl_utils.py
- __init__.py
- version.py
- LICENSE
- pyproject.toml
- README.md
- requirements.txt
- setup.py
- masks1.png
- masks2.jpg
- model_diagram.png
- notebook1.png
- notebook2.png
- dog.jpg
- groceries.jpg
- truck.jpg
- automatic_mask_generator_example.ipynb
- onnx_model_example.ipynb
- predictor_example.ipynb
- amg.py
- export_onnx_model.py
- __init__.py
- common.py
- image_encoder.py
- mask_decoder.py
- mask_decoder_hq.py
- prompt_encoder.py
- sam.py
- transformer.py
- __init__.py
- amg.py
- onnx.py
- transforms.py
- __init__.py
- automatic_mask_generator.py
- build_sam.py
- build_sam_hq.py
- predictor.py
- CODE_OF_CONDUCT.md
- CONTRIBUTING.md
- LICENSE
- linter.sh
- README.md
- setup.cfg
- setup.py
- automatic_label_demo.py
- automatic_label_ram_demo.py
- automatic_label_simple_demo.py
- automatic_label_tag2text_demo.py
- chatbot.py
- CITATION.cff
- cog.yaml
- compbench_eval_spatial_relationships.py
- compbench_motion_binding_seg.py
- Dockerfile
- gradio_app.py
- grounded_sam.ipynb
- grounded_sam_3d_box.ipynb
- grounded_sam_colab_demo.ipynb
- grounded_sam_demo.py
- grounded_sam_inpainting_demo.py
- grounded_sam_osx_demo.py
- grounded_sam_simple_demo.py
- grounded_sam_visam.py
- grounded_sam_whisper_demo.py
- grounded_sam_whisper_inpainting_demo.py
- grounding_dino_demo.py
- LICENSE
- Makefile
- predict.py
- README.md
- requirements.txt
- Customize_Component.md
- Data.md
- Evaluation.md
- Finetune_Custom_Data.md
- Intel.md
- LLaVA_Bench.md
- LLaVA_from_LLaMA2.md
- LoRA.md
- macOS.md
- MODEL_ZOO.md
- ScienceQA.md
- Windows.md
- demo_cli.gif
- llava_example_cmp.png
- llava_logo.png
- llava_v1_5_radar.jpg
- answer_alpaca-13b.jsonl
- answer_bard.jsonl
- answer_gpt35.jsonl
- answer_llama-13b.jsonl
- answer_vicuna-13b.jsonl
- test_sqa_llava_13b_v0.json
- test_sqa_llava_lcs_558k_sqa_12e_vicuna_v1_3_13b.json
- review_alpaca-13b_vicuna-13b.jsonl
- review_bard_vicuna-13b.jsonl
- review_gpt35_vicuna-13b.jsonl
- review_llama-13b_vicuna-13b.jsonl
- caps_boxes_coco2014_val_80.jsonl
- model.jsonl
- prompt.jsonl
- question.jsonl
- reviewer.jsonl
- rule.json
- alpaca.png
- bard.jpg
- chatgpt.svg
- llama.jpg
- swords_FILL0_wght300_GRAD0_opsz48.svg
- vicuna.jpeg
- index.html
- script.js
- styles.css
- compbench_eval_action_binding.py
- compbench_eval_consistent_attr.py
- compbench_eval_dynamic_attr.py
- compbench_eval_interaction.py
- eval_gpt_review.py
- eval_gpt_review_bench.py
- eval_gpt_review_visual.py
- eval_pope.py
- eval_science_qa.py
- eval_science_qa_gpt4.py
- eval_science_qa_gpt4_requery.py
- eval_textvqa.py
- generate_webpage_data_from_table.py
- m4c_evaluator.py
- model_qa.py
- model_vqa.py
- model_vqa_loader.py
- model_vqa_mmbench.py
- model_vqa_science.py
- qa_baseline_gpt35.py
- run_llava.py
- summarize_gpt_review.py
- llava_llama.py
- llava_mistral.py
- llava_mpt.py
- builder.py
- clip_encoder.py
- builder.py
- __init__.py
- apply_delta.py
- builder.py
- consolidate.py
- llava_arch.py
- make_delta.py
- utils.py
- extreme_ironing.jpg
- waterview.jpg
- __init__.py
- cli.py
- controller.py
- gradio_web_server.py
- model_worker.py
- register_worker.py
- sglang_worker.py
- test_message.py
- llama_flash_attn_monkey_patch.py
- llama_xformers_attn_monkey_patch.py
- llava_trainer.py
- train.py
- train_mem.py
- train_xformers.py
- __init__.py
- constants.py
- conversation.py
- mm_utils.py
- utils.py
- qa90_gpt4_answer.jsonl
- qa90_questions.jsonl
- 000_caps.txt
- 000_conv.txt
- 001_caps.txt
- 001_conv.txt
- 002_caps.txt
- 002_conv.txt
- system_message.txt
- 000_caps.txt
- 000_conv.txt
- 001_caps.txt
- 001_conv.txt
- system_message.txt
- 000_caps.txt
- 000_conv.txt
- 001_caps.txt
- 001_conv.txt
- 002_caps.txt
- 002_conv.txt
- system_message.txt
- coco2014_val_gpt4_qa_30x3.jsonl
- gqa.sh
- llavabench.sh
- mmbench.sh
- mmbench_cn.sh
- mme.sh
- mmvet.sh
- pope.sh
- qbench.sh
- qbench_zh.sh
- seed.sh
- sqa.sh
- textvqa.sh
- vizwiz.sh
- vqav2.sh
- finetune.sh
- finetune_lora.sh
- finetune_task.sh
- finetune_task_lora.sh
- pretrain.sh
- convert_gqa_for_eval.py
- convert_mmbench_for_submission.py
- convert_mmvet_for_eval.py
- convert_seed_for_submission.py
- convert_sqa_to_llava.py
- convert_sqa_to_llava_base_prompt.py
- convert_vizwiz_for_submission.py
- convert_vqav2_for_submission.py
- extract_mm_projector.py
- finetune.sh
- finetune_full_schedule.sh
- finetune_lora.sh
- finetune_qlora.sh
- finetune_sqa.sh
- merge_lora_weights.py
- pretrain.sh
- pretrain_xformers.sh
- sqa_eval_batch.sh
- sqa_eval_gather.sh
- upload_pypi.sh
- zero2.json
- zero3.json
- zero3_offload.json
- cog.yaml
- LICENSE
- predict.py
- pyproject.toml
- README.md
- action_binding.json
- consistent_attribute_binding.json
- dynamic_attribute_binding.json
- generative_numeracy.json
- motion_binding.json
- object_interactions.json
- spatial_relationships.json
- 1_consistent_attr.txt
- 2_dynamic_attr.txt
- 3_spatial_relationship.txt
- 4_motion_binding.txt
- 5_action_binding.txt
- 6_interaction.txt
- 7_numeracy.txt
- README.md
- word_list.py
# 설치 가이드
1. 코드 내려받기
git clone https://github.com/KaiyueSun98/T2V-CompBench
깃허브에서 프로젝트 코드 전체를 내 컴퓨터로 내려받습니다.
cd T2V-CompBench
방금 내려받은 프로젝트 폴더 안으로 이동합니다.
2. 공식 설치 스크립트
쉬움 추천사전 준비물
- Python 3 pip 명령어를 쓰려면 Python이 필요합니다.
pip install --upgrade pip # enable PEP 660 support
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
pip install flash-attn --no-build-isolation --no-cache-dir
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
설치 후 새 터미널을 열고, 프로그램의 버전 확인 명령(예: --version)으로 정상 설치됐는지 확인하세요.
이 레포의 README에 적힌 실제 명령어를 그대로 가져왔습니다.
3. Docker
쉬움사전 준비물
- Git GitHub에서 프로젝트 코드를 내려받으려면 필요합니다.
- Docker Desktop 컨테이너를 빌드하고 실행하려면 필요합니다. 설치 후 실행해서 백그라운드에 켜두세요.
docker build -f Grounded-Segment-Anything/Dockerfile -t t2v-compbench .
Dockerfile을 기반으로 실행 가능한 이미지를 빌드합니다.
docker run -p 8080:80 t2v-compbench
빌드된 이미지를 실제 컨테이너로 실행합니다.
터미널에 docker compose ps 를 입력해 컨테이너들이 Up 상태인지 확인하세요. README에 포트 번호가 적혀있다면 브라우저에서 http://localhost:포트번호 로 접속해보세요.
4. Python
쉬움사전 준비물
pip install --upgrade pip # enable PEP 660 support
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
pip install -e .
requirements.txt 등에 명시된 파이썬 라이브러리를 설치합니다.
pip install -e ".[train]"
requirements.txt 등에 명시된 파이썬 라이브러리를 설치합니다.
pip install flash-attn --no-build-isolation --no-cache-dir
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
python -m pip install -e segment_anything
requirements.txt 등에 명시된 파이썬 라이브러리를 설치합니다.
에러 메시지 없이 실행되고 터미널에 안내 문구가 출력되면 정상입니다.
이 레포의 README에 적힌 실제 명령어를 그대로 가져왔습니다.
5. Make
보통사전 준비물
- Git GitHub에서 프로젝트 코드를 내려받으려면 필요합니다.
- Make Linux/macOS는 보통 기본 설치되어 있습니다. Windows는 별도 설치(예: MSYS2, WSL)가 필요합니다.
cd Grounded-Segment-Anything
이 프로젝트의 관련 파일이 하위 폴더 안에 있어서, 먼저 그 폴더로 이동합니다.
make
생성된 빌드 설정을 바탕으로 실제 컴파일을 진행해 실행 파일을 만듭니다.
에러 없이 끝나면 성공입니다. 생성된 실행 파일을 직접 실행해보세요.
// repository documentation
Was this content helpful?
(0 ratings)
