GrokkedTransformer
Code for NeurIPS'24 paper 'Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization'
File Explorer
Download Latest Version (.zip)Showing a partial file list β download the zip above to see everything.
- 1.png
- bug_report.md
- feature_request.md
- pythonpublish.yml
- FUNDING.yml
- stale.yml
- simple-viewer
- comment-1473870213530.yml
- comment-1478213467992.yml
- comment-1500181304581.yml
- comment-1500214855350.yml
- comment-1479508047505.yml
- comment-1480591890264.yml
- comment-1482532165381.yml
- comment-1483456786593.yml
- comment-1483457152038.yml
- comment-1519412839827.yml
- comment-1470944006665.yml
- comment-1470944162041.yml
- comment-1472308473018.yml
- comment-1514406795156.yml
- comment-1514407115153.yml
- comment-1538482988032.yml
- comment-1483124729757.yml
- comment-1483128389943.yml
- comment-1474306861206.yml
- comment-1479253931238.yml
- comment-1479265677846.yml
- comment-1512840683260.yml
- comment-1513110608614.yml
- comment-1513111329875.yml
- comment-1513111563922.yml
- comment-1500183131535.yml
- comment-1500214974083.yml
- comment-1519247076880.yml
- comment-1519247290410.yml
- comment-1520748170396.yml
- comment-1492811460488.yml
- comment-1492812977693.yml
- comment-1512118683486.yml
- comment-1520683848241.yml
- comment-1527082094887.yml
- comment-1527500055863.yml
- comment-1527690060032.yml
- comment-1527690281769.yml
- comment-1540422628114.yml
- comment-1534823211504.yml
- comment-1472040323579.yml
- comment-1472146638519.yml
- comment-1470969665387.yml
- comment-1478928407894.yml
- comment-1487758246637.yml
- comment-1505403032256.yml
- comment-1505403241808.yml
- comment-1514836962551.yml
- comment-1472064560364.yml
- comment-1472786137736.yml
- comment-1500055247314.yml
- comment-1500056210776.yml
- comment-1497284119888.yml
- comment-1497284892766.yml
- comment-1520673777110.yml
- comment-1506623182288.yml
- comment-1506623710918.yml
- comment-1506632190623.yml
- comment-1470942205700.yml
- comment-1470942247755.yml
- comment-1470942265819.yml
- comment-1470942493518.yml
- comment-1471823346931.yml
- comment-1471834988411.yml
- comment-1472786599470.yml
- comment-1474328950155.yml
- comment-1500505983331.yml
- comment-1507141538771.yml
- comment-1529792272424.yml
- comment-1529794012288.yml
- authors.yml
- navigation.yml
- 01-installation.md
- 02-upgrading.md
- 03-usage.md
- 03.5-tips-and-tricks.md
- 04-classification-specifics.md
- 05-classification-models.md
- 06-classification-data-formats.md
- 07-binary-classification.md
- 08-multi-class-classification.md
- 09-regression.md
- 10-sentence-pair-classification.md
- 11-multi-label-classification.md
- 12-ner-specifics.md
- 13-ner-model.md
- 14-ner-data-formats.md
- 15-ner-minimal-start.md
- 16-qa-specifics.md
- 17-qa-model.md
- 18-qa-data-formats.md
- 19-qa-minimal-start.md
- 20-lm-specifics.md
- 21-lm-model.md
- 22-lm-data-formats.md
- 23-lm-minimal-start.md
- 24-t5-specifics.md
- 25-t5-model.md
- 26-t5-data-formats.md
- 27-t5-minimal-start.md
- 28-seq2seq-specifics.md
- 29-seq2seq-model.md
- 30-seq2seq-data-formats.md
- 31-seq2seq-minimal-start.md
- 32-convAI-specifics.md
- 33-convAI-model.md
- 34-convAI-data-formats.md
- 35-convAI-minimal-start.md
- 36-text-rep-examples.md
- 37-text-rep-model.md
- 38-language-generation-specifics.md
- 39-language-generation-model.md
- 40-language-generation-minimal-start.md
- 41-multi-modal-classification-specifics.md
- 42-multi-modal-classification-model.md
- 43-multi-modal-classification-data-formats.md
- 49-history.md
- 50-contributing.md
- 51-docs-old.md
- 52-license.md
- 53-terms.md
- 54-retrieval-specifics.md
- 55-retrieval-model.md
- 56-retrieval-data-formats.md
- 57-retrieval-minimal-start.md
- post-draft.md
- 404.md
- about.md
- archive-layout-with-content.md
- category-archive.md
- collection-archive.html
- edge-case.md
- home.md
- lorem-ipsum.md
- markup.md
- page-a.md
- page-archive.html
- page-b.md
- pets.md
- portfolio-archive.md
- post-archive-feature-rows.html
- recipes-archive.md
- sample-page.md
- sitemap.md
- splash-page.md
- tag-archive.md
- terms.md
- tutorials.md
- year-archive.md
- _air.scss
- _aqua.scss
- _contrast.scss
- _dark.scss
- _default.scss
- _dirt.scss
- _mint.scss
- _neon.scss
- _plum.scss
- _sunrise.scss
- _animations.scss
- _archive.scss
- _base.scss
- _buttons.scss
- _footer.scss
- _forms.scss
- _masthead.scss
- _mixins.scss
- _navigation.scss
- _notices.scss
- _page.scss
- _print.scss
- _reset.scss
- _search.scss
- _sidebar.scss
- _syntax.scss
- _tables.scss
- _utilities.scss
- _variables.scss
- minimal-mistakes.scss
- 3953273590_704e3899d5_m.jpg
- 500x300.png
- air-skin-archive-large.png
- air-skin-archive.png
- air-skin-post-large.png
- air-skin-post.png
- android-chrome-144x144.png
- android-chrome-192x192.png
- android-chrome-36x36.png
- android-chrome-48x48.png
- android-chrome-72x72.png
- android-chrome-96x96.png
- apple-touch-icon-114x114.png
- apple-touch-icon-120x120.png
- apple-touch-icon-144x144.png
- apple-touch-icon-152x152.png
- apple-touch-icon-180x180.png
- apple-touch-icon-57x57.png
- apple-touch-icon-60x60.png
- apple-touch-icon-72x72.png
- apple-touch-icon-76x76.png
- apple-touch-icon-precomposed.png
- apple-touch-icon.png
- aqua-skin-archive-large.png
- aqua-skin-archive.png
- aqua-skin-post-large.png
- aqua-skin-post.png
- bio-photo-2.jpg
- bio-photo.jpg
- browserconfig.xml
- contrast-code-block.jpg
- contrast-skin-archive-large.png
- contrast-skin-archive.png
- contrast-skin-post-large.png
- contrast-skin-post.png
- dark-code-block.jpg
- dark-skin-archive-large.png
- dark-skin-archive.png
- dark-skin-post-large.png
- dark-skin-post.png
- default-code-block.jpg
- dirt-skin-archive-large.png
- dirt-skin-archive.png
- dirt-skin-post-large.png
- dirt-skin-post.png
- dracula-code-block.jpg
- facebook-share-example.jpg
- favicon-16x16.png
- favicon-32x32.png
- favicon-96x96.png
- favicon.ico
- foo-bar-identity-th.jpg
- foo-bar-identity.jpg
- google-custom-search-engine-layout.png
- home-1.jpg
- home.jpeg
- image-alignment-1200x4002.jpg
- image-alignment-150x150.jpg
- image-alignment-300x200.jpg
- image-alignment-580x300.jpg
- manifest.json
- markup-syntax-highlighting-teaser.jpg
- masthead-search.gif
- michael-rose.jpg
- mint-skin-archive-large.png
- mint-skin-archive.png
- mint-skin-post-large.png
- mint-skin-post.png
- mm-archive-grid-view-example.jpg
- mm-author-profile-reddit-color.png
- mm-author-profile-reddit-gs.png
- mm-author-sidebar-example.jpg
- mm-breadcrumbs-example.jpg
- mm-browser-mockups.png
- mm-bundle-install.gif
- mm-custom-sidebar-example.jpg
- mm-custom-sidebar-nav.jpg
- mm-customizable-feature.png
- mm-free-feature.png
- mm-gh-pages.gif
- mm-github-copy-repo-url.jpg
- mm-github-edit-config.gif
- mm-header-overlay-black-filter.jpg
- mm-header-overlay-red-filter.jpg
- mm-home-page-feature.jpg
- mm-home-post-pagination-example.jpg
- mm-layout-archive-taxonomy.png
- mm-layout-archive.png
- mm-layout-examples.png
- mm-layout-single-header.png
- mm-layout-single-meta.png
- mm-layout-single.png
- mm-layout-splash.png
- mm-masthead-logo.png
- mm-paragraph-indent-example.jpg
- mm-portfolio-collection-example.jpg
- mm-priority-plus-masthead.gif
- mm-read-time-example.jpg
- mm-responsive-feature.png
- mm-single-header-example.jpg
- mm-single-header-overlay-example.jpg
- mm-single-header-overlay-fill-example.jpg
- mm-social-share-links-default.png
- mm-social-share-links-reddit-color.png
- mm-social-share-links-reddit-gs.png
- mm-staticman-pr-webhook.jpg
- mm-susy-grid-overlay.jpg
- mm-teaser-images-example.jpg
- mm-theme-fork-repo.png
- mm-theme-post-600.jpg
- mm-theme-post-750.jpg
- mm-toc-helper-example.jpg
- mm-twitter-card-summary-image.jpg
- mm-twitter-card-summary-large.jpg
- mm-ui-text-labels.jpg
- mstile-144x144.png
- mstile-150x150.png
- mstile-310x150.png
- mstile-310x310.png
- mstile-70x70.png
- neon-code-block.jpg
- neon-skin-archive-large.png
- neon-skin-archive.png
- neon-skin-post-large.png
- neon-skin-post.png
- noun_Lightning.svg
- page-header-image.png
- page-header-og-image.png
- page-header-overlay-image.png
- page-header-teaser.png
- paragraph-indent.png
- paragraph-no-indent.png
- plum-code-block.jpg
- plum-skin-archive-large.png
- plum-skin-archive.png
- plum-skin-post-large.png
- plum-skin-post.png
- robot-face-emoji-by-google.png
- safari-pinned-tab.svg
- search-layout-example.png
- site-logo.png
- social-media-preview.png
- solarized-light-code-block.jpg
- sunrise-code-block.jpg
- sunrise-skin-archive-large.png
- sunrise-skin-archive.png
- sunrise-skin-post-large.png
- sunrise-skin-post.png
- thilina-rajapakse.jpeg
- unsplash-gallery-image-1-th.jpg
- unsplash-gallery-image-1.jpg
- unsplash-gallery-image-2-th.jpg
- unsplash-gallery-image-2.jpg
- unsplash-gallery-image-3-th.jpg
- unsplash-gallery-image-3.jpg
- unsplash-gallery-image-4-th.jpg
- unsplash-gallery-image-4.jpg
- unsplash-image-1.jpg
- unsplash-image-10.jpg
- unsplash-image-11.jpg
- unsplash-image-2.jpg
- unsplash-image-3.jpg
- unsplash-image-4.jpg
- unsplash-image-5.jpg
- unsplash-image-6.jpg
- unsplash-image-7.jpg
- unsplash-image-8.jpg
- unsplash-image-9.jpg
- .gitignore
- 404.html
- _config.yml
- CNAME
- favicon.ico
- Gemfile
- index.html
- screenshot-layouts.png
- screenshot.png
- data_prep.py
- readme.md
- sweep_layerwise.py
- sweep_vanilla.py
- train_default.py
- train_layerwise.py
- train_vanilla.py
- utils.py
- sweeps.py
- data_prep.py
- fine_tune.py
- generate.py
- train_new_lm.py
- classification_yelp.py
- data_download.sh
- binary_classification_dummy.py
- named_entity_recognition.py
- lazy_qa.py
- question_answering.py
- data_download.sh
- predict.py
- readme.md
- train.py
- utils.py
- minimal_seq2seq.py
- data_prep.ipynb
- test.py
- train.py
- data_prep.ipynb
- test.py
- test_multi_lang.py
- train.py
- translate_dataset.py
- translation_models.py
- data_prep.ipynb
- readme.md
- test.py
- train.py
- data_prep.py
- predict.py
- test.py
- train.py
- data_download.sh
- run_trainers.sh
- train.py
- binary_classification.py
- lazy_loading_regression.py
- multiclass_classification.py
- multilabel_classification.py
- __init__.py
- albert_model.py
- bert_model.py
- camembert_model.py
- distilbert_model.py
- electra_model.py
- flaubert_model.py
- layoutlm_model.py
- longformer_model.py
- mmbt_model.py
- mobilebert_model.py
- roberta_model.py
- xlm_model.py
- xlm_roberta_model.py
- xlnet_model.py
- __init__.py
- classification_model.py
- classification_utils.py
- multi_label_classification_model.py
- multi_modal_classification_model.py
- __init__.py
- global_args.py
- model_args.py
- utils.py
- __init__.py
- conv_ai_model.py
- conv_ai_utils.py
- __init__.py
- models.py
- __init__.py
- albert_model.py
- bert_model.py
- camembert_model.py
- distilbert_model.py
- roberta_model.py
- xlm_model.py
- xlnet_model.py
- __init__.py
- classification_model.py
- classification_utils.py
- multi_label_classification_model.py
- __init__.py
- __init__.py
- language_generation_model.py
- language_generation_utils.py
- __init__.py
- language_modeling_model.py
- language_modeling_utils.py
- __init__.py
- bert_model.py
- gpt2_model.py
- __init__.py
- representation_model.py
- __init__.py
- dice_loss.py
- focal_loss.py
- loss_utils.py
- tversky_loss.py
- ner_dataset_loading_script.py
- __init__.py
- ner_model.py
- ner_utils.py
- qa_dataset_loading_script.py
- __init__.py
- question_answering_model.py
- question_answering_utils.py
- retrieval_dataset_loading_script.py
- __init__.py
- retrieval_model.py
- retrieval_utils.py
- __init__.py
- seq2seq_model.py
- seq2seq_utils.py
- __init__.py
- classification_view.py
- ner_view.py
- qa_view.py
- simple_view.py
- streamlit_utils.py
- t5_view.py
- __init__.py
- t5_model.py
- t5_utils.py
- __init__.py
- model.py
- test_language_modeling_only.py
- test_classification.py
- test_language_modeling.py
- test_language_representation.py
- test_named_entity_recognition.py
- test_question_answering.py
- test_seq2seq.py
- test_t5.py
- train.txt
- .all-contributorsrc
- .gitignore
- CHANGELOG.md
- LICENSE
- Makefile
- README.md
- requirements-dev.txt
- setup.cfg
- setup.py
- train.txt
- config.yml
- create_circleci_config.py
- TROUBLESHOOT.md
- build.sh
- meta.yaml
- bug-report.yml
- config.yml
- feature-request.yml
- i18n.md
- migration.yml
- new-model-addition.yml
- add-model-like.yml
- build-docker-images.yml
- build-nightly-ci-docker-images.yml
- build-past-ci-docker-images.yml
- build_documentation.yml
- build_pr_documentation.yml
- check_tiny_models.yml
- doctests.yml
- model-templates.yml
- release-conda.yml
- self-nightly-past-ci-caller.yml
- self-nightly-scheduled.yml
- self-past.yml
- self-push-amd-mi210-caller.yml
- self-push-amd-mi250-caller.yml
- self-push-amd.yml
- self-push-caller.yml
- self-push.yml
- self-scheduled-amd-caller.yml
- self-scheduled-amd-mi210-caller.yml
- self-scheduled-amd-mi250-caller.yml
- self-scheduled-amd.yml
- self-scheduled.yml
- stale.yml
- TROUBLESHOOT.md
- update_metdata.yml
- upload_pr_documentation.yml
- PULL_REQUEST_TEMPLATE.md
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- Dockerfile
- bert-base-cased.jsonnet
- dataset.yaml
- docker-entrypoint.sh
- Dockerfile
- Dockerfile
- Dockerfile
- _config.py
- _toctree.yml
- accelerate.md
- add_new_model.md
- add_new_pipeline.md
- add_tensorflow_model.md
- autoclass_tutorial.md
- index.md
- installation.md
- llm_tutorial.md
- model_sharing.md
- peft.md
- pipeline_tutorial.md
- pr_checks.md
- preprocessing.md
- quicktour.md
- run_scripts.md
- testing.md
- training.md
- transformers_agents.md
- audio_utils.md
- file_utils.md
- generation_utils.md
- image_processing_utils.md
- modeling_utils.md
- pipelines_utils.md
- time_series_utils.md
- tokenization_utils.md
- trainer_utils.md
- agent.md
- backbones.md
- callback.md
- configuration.md
- data_collator.md
- deepspeed.md
- feature_extractor.md
- image_processor.md
- keras_callbacks.md
- logging.md
- model.md
- onnx.md
- optimizer_schedules.md
- output.md
- pipelines.md
- processors.md
- quantization.md
- text_generation.md
- tokenizer.md
- trainer.md
- albert.md
- align.md
- altclip.md
- audio-spectrogram-transformer.md
- auto.md
- autoformer.md
- bark.md
- bart.md
- barthez.md
- bartpho.md
- beit.md
- bert-generation.md
- bert-japanese.md
- bert.md
- bertweet.md
- big_bird.md
- bigbird_pegasus.md
- biogpt.md
- bit.md
- blenderbot-small.md
- blenderbot.md
- blip-2.md
- blip.md
- bloom.md
- bort.md
- bridgetower.md
- bros.md
- byt5.md
- camembert.md
- canine.md
- chinese_clip.md
- clap.md
- clip.md
- clipseg.md
- clvp.md
- code_llama.md
- codegen.md
- conditional_detr.md
- convbert.md
- convnext.md
- convnextv2.md
- cpm.md
- cpmant.md
- ctrl.md
- cvt.md
- data2vec.md
- deberta-v2.md
- deberta.md
- decision_transformer.md
- deformable_detr.md
- deit.md
- deplot.md
- deta.md
- detr.md
- dialogpt.md
- dinat.md
- dinov2.md
- distilbert.md
- dit.md
- donut.md
- dpr.md
- dpt.md
- efficientformer.md
- efficientnet.md
- electra.md
- encodec.md
- encoder-decoder.md
- ernie.md
- ernie_m.md
- esm.md
- falcon.md
- flan-t5.md
- flan-ul2.md
- flaubert.md
- flava.md
- fnet.md
- focalnet.md
- fsmt.md
- funnel.md
- fuyu.md
- git.md
- glpn.md
- gpt-sw3.md
- gpt2.md
- gpt_bigcode.md
- gpt_neo.md
- gpt_neox.md
- gpt_neox_japanese.md
- gptj.md
- gptsan-japanese.md
- graphormer.md
- groupvit.md
- herbert.md
- hubert.md
- ibert.md
- idefics.md
- imagegpt.md
- informer.md
- instructblip.md
- jukebox.md
- kosmos-2.md
- layoutlm.md
- layoutlmv2.md
- layoutlmv3.md
- layoutxlm.md
- led.md
- levit.md
- lilt.md
- llama.md
- llama2.md
- llava.md
- longformer.md
- longt5.md
- luke.md
- lxmert.md
- m2m_100.md
- madlad-400.md
- marian.md
- markuplm.md
- mask2former.md
- maskformer.md
- matcha.md
- mbart.md
- mctct.md
- mega.md
- megatron-bert.md
- megatron_gpt2.md
- mgp-str.md
- mistral.md
- mixtral.md
- mluke.md
- mms.md
- mobilebert.md
- mobilenet_v1.md
- mobilenet_v2.md
- mobilevit.md
- mobilevitv2.md
- mpnet.md
- mpt.md
- mra.md
- mt5.md
- musicgen.md
- mvp.md
- nat.md
- nezha.md
- nllb-moe.md
- nllb.md
- nougat.md
- nystromformer.md
- oneformer.md
- open-llama.md
- openai-gpt.md
- opt.md
- owlv2.md
- owlvit.md
- patchtsmixer.md
- patchtst.md
- pegasus.md
- pegasus_x.md
- perceiver.md
- persimmon.md
- phi.md
- phobert.md
- pix2struct.md
- plbart.md
- poolformer.md
- pop2piano.md
- prophetnet.md
- pvt.md
- qdqbert.md
- rag.md
- realm.md
- reformer.md
- regnet.md
- rembert.md
- resnet.md
- retribert.md
- roberta-prelayernorm.md
- roberta.md
- roc_bert.md
- roformer.md
- rwkv.md
- sam.md
- seamless_m4t.md
- seamless_m4t_v2.md
- segformer.md
- sew-d.md
- sew.md
- speech-encoder-decoder.md
- speech_to_text.md
- speech_to_text_2.md
- speecht5.md
- splinter.md
- squeezebert.md
- swiftformer.md
- swin.md
- swin2sr.md
- swinv2.md
- switch_transformers.md
- t5.md
- t5v1.1.md
- table-transformer.md
- tapas.md
- tapex.md
- time_series_transformer.md
- timesformer.md
- trajectory_transformer.md
- transfo-xl.md
- trocr.md
- tvlt.md
- tvp.md
- ul2.md
- umt5.md
- unispeech-sat.md
- unispeech.md
- univnet.md
- upernet.md
- van.md
- videomae.md
- vilt.md
- vipllava.md
- vision-encoder-decoder.md
- vision-text-dual-encoder.md
- visual_bert.md
- vit.md
- vit_hybrid.md
- vit_mae.md
- vit_msn.md
- vitdet.md
- vitmatte.md
- vits.md
- vivit.md
- wav2vec2-conformer.md
- wav2vec2.md
- wav2vec2_phoneme.md
- wavlm.md
- whisper.md
- xclip.md
- xglm.md
- xlm-prophetnet.md
- xlm-roberta-xl.md
- xlm-roberta.md
- xlm-v.md
- xlm.md
- xlnet.md
- xls_r.md
- xlsr_wav2vec2.md
- xmod.md
- yolos.md
- yoso.md
- asr.md
- audio_classification.md
- document_question_answering.md
- idefics.md
- image_captioning.md
- image_classification.md
- image_to_image.md
- knowledge_distillation_for_image_classification.md
- language_modeling.md
- masked_language_modeling.md
- monocular_depth_estimation.md
- multiple_choice.md
- object_detection.md
- prompting.md
- question_answering.md
- semantic_segmentation.md
- sequence_classification.md
- summarization.md
- text-to-speech.md
- token_classification.md
- translation.md
- video_classification.md
- visual_question_answering.md
- zero_shot_image_classification.md
- zero_shot_object_detection.md
- _config.py
- _redirects.yml
- _toctree.yml
- accelerate.md
- add_new_model.md
- add_new_pipeline.md
- add_tensorflow_model.md
- attention.md
- autoclass_tutorial.md
- benchmarks.md
- bertology.md
- big_models.md
- chat_templating.md
- community.md
- contributing.md
- create_a_model.md
- custom_models.md
- custom_tools.md
- debugging.md
- fast_tokenizers.md
- generation_strategies.md
- glossary.md
- hpo_train.md
- index.md
- installation.md
- llm_tutorial.md
- llm_tutorial_optimization.md
- model_memory_anatomy.md
- model_sharing.md
- model_summary.md
- multilingual.md
- notebooks.md
- pad_truncation.md
- peft.md
- perf_hardware.md
- perf_infer_cpu.md
- perf_infer_gpu_one.md
- perf_torch_compile.md
- perf_train_cpu.md
- perf_train_cpu_many.md
- perf_train_gpu_many.md
- perf_train_gpu_one.md
- perf_train_special.md
- perf_train_tpu.md
- perf_train_tpu_tf.md
- performance.md
- perplexity.md
- philosophy.md
- pipeline_tutorial.md
- pipeline_webserver.md
- pr_checks.md
- preprocessing.md
- quantization.md
- quicktour.md
- run_scripts.md
- sagemaker.md
- serialization.md
- task_summary.md
- tasks_explained.md
- testing.md
- tf_xla.md
- tflite.md
- tokenizer_summary.md
- torchscript.md
- training.md
- transformers_agents.md
- troubleshooting.md
- asr.md
- image_classification.md
- language_modeling.md
- multiple_choice.md
- question_answering.md
- summarization.md
- _config.py
- _toctree.yml
- accelerate.md
- add_new_pipeline.md
- autoclass_tutorial.md
- bertology.md
- community.md
- converting_tensorflow_models.md
- create_a_model.md
- custom_models.md
- debugging.md
- fast_tokenizers.md
- glossary.md
- index.md
- installation.md
- model_sharing.md
- multilingual.md
- pad_truncation.md
- perplexity.md
- philosophy.md
- pipeline_tutorial.md
- pr_checks.md
- preprocessing.md
- quicktour.md
- run_scripts.md
- sagemaker.md
- serialization.md
- training.md
- _config.py
- _toctree.yml
- autoclass_tutorial.md
- in_translation.md
- index.md
- installation.md
- quicktour.md
- _toctree.yml
- pipeline_tutorial.md
- _config.py
- _toctree.yml
- accelerate.md
- add_new_model.md
- add_new_pipeline.md
- autoclass_tutorial.md
- big_models.md
- community.md
- converting_tensorflow_models.md
- create_a_model.md
- custom_models.md
- debugging.md
- index.md
- installation.md
- migration.md
- model_sharing.md
- multilingual.md
- perf_hardware.md
- perf_infer_cpu.md
- perf_infer_gpu_many.md
- perf_infer_gpu_one.md
- perf_infer_special.md
- perf_train_cpu.md
- perf_train_cpu_many.md
- perf_train_special.md
- perf_train_tpu.md
- pipeline_tutorial.md
- pr_checks.md
- preprocessing.md
- quicktour.md
- run_scripts.md
- serialization.md
- training.md
- audio_utils.md
- file_utils.md
- generation_utils.md
- image_processing_utils.md
- modeling_utils.md
- pipelines_utils.md
- time_series_utils.md
- tokenization_utils.md
- trainer_utils.md
- agent.md
- callback.md
- configuration.md
- data_collator.md
- deepspeed.md
- feature_extractor.md
- image_processor.md
- keras_callbacks.md
- logging.md
- model.md
- onnx.md
- optimizer_schedules.md
- output.md
- pipelines.md
- processors.md
- quantization.md
- text_generation.md
- tokenizer.md
- trainer.md
- albert.md
- align.md
- altclip.md
- audio-spectrogram-transformer.md
- auto.md
- autoformer.md
- bark.md
- bart.md
- barthez.md
- bartpho.md
- beit.md
- bert-generation.md
- bert-japanese.md
- bert.md
- bertweet.md
- big_bird.md
- bigbird_pegasus.md
- biogpt.md
- bit.md
- blenderbot-small.md
- blenderbot.md
- blip-2.md
- blip.md
- bloom.md
- bort.md
- bridgetower.md
- bros.md
- byt5.md
- camembert.md
- canine.md
- chinese_clip.md
- clap.md
- clip.md
- clipseg.md
- clvp.md
- code_llama.md
- codegen.md
- conditional_detr.md
- convbert.md
- convnext.md
- convnextv2.md
- cpm.md
- cpmant.md
- ctrl.md
- cvt.md
- data2vec.md
- deberta-v2.md
- deberta.md
- decision_transformer.md
- deformable_detr.md
- asr.md
- audio_classification.md
- document_question_answering.md
- idefics.md
- image_captioning.md
- image_classification.md
- image_to_image.md
- knowledge_distillation_for_image_classification.md
- language_modeling.md
- masked_language_modeling.md
- monocular_depth_estimation.md
- multiple_choice.md
- object_detection.md
- prompting.md
- question_answering.md
- semantic_segmentation.md
- sequence_classification.md
- summarization.md
- text-to-speech.md
- token_classification.md
- translation.md
- video_classification.md
- visual_question_answering.md
- zero_shot_image_classification.md
- zero_shot_object_detection.md
- _toctree.yml
- accelerate.md
- add_new_model.md
- add_tensorflow_model.md
- attention.md
- autoclass_tutorial.md
- benchmarks.md
- bertology.md
- big_models.md
- chat_templating.md
- community.md
- create_a_model.md
- custom_models.md
- custom_tools.md
- fast_tokenizers.md
- generation_strategies.md
- glossary.md
- hpo_train.md
- index.md
- installation.md
- llm_tutorial.md
- model_memory_anatomy.md
- model_sharing.md
- model_summary.md
- multilingual.md
- pad_truncation.md
- peft.md
- perf_hardware.md
- perf_infer_cpu.md
- perf_infer_gpu_many.md
- perf_infer_gpu_one.md
- perf_infer_special.md
- perf_torch_compile.md
- perf_train_cpu.md
- perf_train_cpu_many.md
- perf_train_gpu_many.md
- perf_train_gpu_one.md
- perf_train_special.md
- perf_train_tpu.md
- perf_train_tpu_tf.md
- performance.md
- perplexity.md
- philosophy.md
- pipeline_tutorial.md
- pipeline_webserver.md
- pr_checks.md
- preprocessing.md
- quicktour.md
- run_scripts.md
- serialization.md
- task_summary.md
- tasks_explained.md
- testing.md
- tf_xla.md
- tflite.md
- tokenizer_summary.md
- torchscript.md
- training.md
- transformers_agents.md
- troubleshooting.md
- llama.md
- llama2.md
- whisper.md
- asr.md
- audio_classification.md
- document_question_answering.md
- image_captioning.md
- image_classification.md
- language_modeling.md
- masked_language_modeling.md
- monocular_depth_estimation.md
- multiple_choice.md
- object_detection.md
- question_answering.md
- semantic_segmentation.md
- sequence_classification.md
- summarization.md
- token_classification.md
- translation.md
- video_classification.md
- visual_question_answering.md
- zero_shot_image_classification.md
- zero_shot_object_detection.md
- _config.py
- _toctree.yml
- accelerate.md
- add_new_model.md
- add_new_pipeline.md
- add_tensorflow_model.md
- attention.md
- autoclass_tutorial.md
- bertology.md
- big_models.md
- community.md
- contributing.md
- create_a_model.md
- custom_models.md
- custom_tools.md
- debugging.md
- fast_tokenizers.md
- hpo_train.md
- in_translation.md
- index.md
- installation.md
- llm_tutorial.md
- model_memory_anatomy.md
- model_sharing.md
- model_summary.md
- multilingual.md
- pad_truncation.md
- peft.md
- perf_hardware.md
- perf_infer_cpu.md
- perf_infer_gpu_many.md
- perf_infer_gpu_one.md
- perf_train_cpu.md
- perf_train_cpu_many.md
- perf_train_gpu_many.md
- perf_train_tpu_tf.md
- performance.md
- perplexity.md
- philosophy.md
- pipeline_tutorial.md
- pipeline_webserver.md
- pr_checks.md
- preprocessing.md
- quicktour.md
- run_scripts.md
- sagemaker.md
- serialization.md
- task_summary.md
- tasks_explained.md
- testing.md
- tf_xla.md
- tflite.md
- tokenizer_summary.md
- torchscript.md
- training.md
- transformers_agents.md
- troubleshooting.md
- _toctree.yml
- index.md
- sequence_classification.md
- token_classification.md
- _config.py
- _toctree.yml
- accelerate.md
- converting_tensorflow_models.md
- create_a_model.md
- custom_models.md
- fast_tokenizers.md
- index.md
- installation.md
- multilingual.md
- pipeline_tutorial.md
- quicktour.md
- run_scripts.md
- serialization.md
- training.md
- _toctree.yml
- index.md
- quicktour.md
- _toctree.yml
- index.md
- audio_utils.md
- file_utils.md
- generation_utils.md
- image_processing_utils.md
- modeling_utils.md
- pipelines_utils.md
- time_series_utils.md
- tokenization_utils.md
- trainer_utils.md
- agent.md
- callback.md
- configuration.md
- data_collator.md
- deepspeed.md
- feature_extractor.md
- image_processor.md
- keras_callbacks.md
- logging.md
- model.md
- onnx.md
- optimizer_schedules.md
- output.md
- pipelines.md
- processors.md
- quantization.md
- text_generation.md
- tokenizer.md
- trainer.md
- _toctree.yml
- accelerate.md
- autoclass_tutorial.md
- big_models.md
- create_a_model.md
- custom_models.md
- debugging.md
- fast_tokenizers.md
- hpo_train.md
- index.md
- installation.md
- llm_tutorial.md
- model_sharing.md
- multilingual.md
- peft.md
- perf_hardware.md
- perf_torch_compile.md
- performance.md
- pipeline_tutorial.md
- preprocessing.md
- quicktour.md
- run_scripts.md
- serialization.md
- task_summary.md
- tf_xla.md
- tflite.md
- tokenizer_summary.md
- training.md
- transformers_agents.md
- _config.py
- README.md
- TRANSLATING.md
- create_model_from_encoder_decoder_models.py
- README.md
- run_image_captioning_flax.py
- README.md
- requirements.txt
- run_bart_dlm_flax.py
- run_clm_flax.py
- run_mlm_flax.py
- run_t5_mlm_flax.py
- t5_tokenizer_model.py
- README.md
- requirements.txt
- run_qa.py
- utils_qa.py
- README.md
- requirements.txt
- run_flax_speech_recognition_seq2seq.py
- README.md
- requirements.txt
- run_summarization_flax.py
- README.md
- requirements.txt
- run_flax_glue.py
- README.md
- requirements.txt
- run_flax_ner.py
- README.md
- requirements.txt
- run_image_classification.py
- _tests_requirements.txt
- conftest.py
- README.md
- test_flax_examples.py
- plot_csv_file.py
- README.md
- requirements.txt
- run_benchmark.py
- run_multiple_choice.py
- utils_multiple_choice.py
- lightning_base.py
- requirements.txt
- run_glue.py
- run_glue.sh
- run_ner.py
- run_ner.sh
- run_pos.sh
- README.md
- run_squad.py
- run_squad_trainer.py
- build-eval-data.py
- fsmt_val_data.json
- test.source
- test.target
- train.len
- train.source
- train.target
- val.len
- val.source
- val.target
- __init__.py
- convert_model_to_fp16.py
- download_wmt.py
- finetune.sh
- finetune_tpu.sh
- finetune_trainer.py
- minify_dataset.py
- old_test_calculate_rouge.py
- old_test_datasets.py
- old_test_fsmt_bleu_score.py
- old_test_seq2seq_examples.py
- old_test_seq2seq_examples_multi_gpu.py
- old_test_tatoeba_conversion.py
- pack_dataset.py
- README.md
- requirements.txt
- romanian_postprocessing.md
- rouge_cli.py
- run_distributed_eval.py
- run_eval.py
- run_eval_search.py
- save_len_file.py
- save_randomly_initialized_model.py
- sentence_splitter.py
- seq2seq_trainer.py
- seq2seq_training_args.py
- train_distil_marian_enro.sh
- train_distil_marian_enro_tpu.sh
- train_distilbart_cnn.sh
- train_mbart_cc25_enro.sh
- utils.py
- xla_spawn.py
- run_tf_text_classification.py
- preprocess.py
- README.md
- run.sh
- run_chunk.sh
- run_ner.py
- run_pos.sh
- run_tf_ner.py
- tasks.py
- utils_ner.py
- README.md
- run_camembert.py
- run_chinese_ref.py
- run_language_modeling.py
- run_openai_gpt.py
- run_swag.py
- run_transfo_xl.py
- README.md
- requirements.txt
- run_audio_classification.py
- README.md
- requirements.txt
- run_clip.py
- README.md
- requirements.txt
- run_image_classification.py
- run_image_classification_no_trainer.py
- README.md
- requirements.txt
- run_mae.py
- run_mim.py
- run_mim_no_trainer.py
- README.md
- requirements.txt
- run_clm.py
- run_clm_no_trainer.py
- run_mlm.py
- run_mlm_no_trainer.py
- run_plm.py
- README.md
- requirements.txt
- run_no_trainer.sh
- run_swag.py
- run_swag_no_trainer.py
- README.md
- requirements.txt
- run_qa.py
- run_qa_beam_search.py
- run_qa_beam_search_no_trainer.py
- run_qa_no_trainer.py
- run_seq2seq_qa.py
- trainer_qa.py
- trainer_seq2seq_qa.py
- utils_qa.py
- README.md
- requirements.txt
- run_semantic_segmentation.py
- run_semantic_segmentation_no_trainer.py
- README.md
- requirements.txt
- run_wav2vec2_pretraining_no_trainer.py
- README.md
- requirements.txt
- run_speech_recognition_ctc.py
- run_speech_recognition_ctc_adapter.py
- run_speech_recognition_seq2seq.py
- README.md
- requirements.txt
- run_summarization.py
- run_summarization_no_trainer.py
- README.md
- requirements.txt
- run_classification.py
- run_glue.py
- run_glue_no_trainer.py
- run_xnli.py
- README.md
- requirements.txt
- run_generation.py
- run_generation_contrastive_search.py
- README.md
- requirements.txt
- run.sh
- run_ner.py
- run_ner_no_trainer.py
- run_no_trainer.sh
- README.md
- requirements.txt
- run_translation.py
- run_translation_no_trainer.py
- _tests_requirements.txt
- conftest.py
- old_test_xla_examples.py
- README.md
- test_accelerate_examples.py
- test_pytorch_examples.py
- xla_spawn.py
- README.md
- requirements.txt
- run_hans.py
- utils_hans.py
- __init__.py
- modeling_pabee_albert.py
- modeling_pabee_bert.py
- README.md
- requirements.txt
- run_glue_with_pabee.py
- test_run_glue_with_pabee.py
- __init__.py
- configuration_bertabs.py
- convert_bertabs_original_pytorch_checkpoint.py
- modeling_bertabs.py
- README.md
- requirements.txt
- run_summarization.py
- test_utils_summarization.py
- utils_summarization.py
- requirements.txt
- run_bertology.py
- run_prune_gpt.py
- README.md
- requirements.txt
- train_complexity_predictor.py
- __init__.py
- test_deduplicate.py
- arguments.py
- bpe_training.py
- codeparrot_training.py
- human_eval.py
- initialize_model.py
- minhash_deduplication.py
- preprocessing.py
- pretokenizing.py
- validation_loss.py
- README.md
- requirements.txt
- requirements.txt
- run_decision_transformer.py
- __init__.py
- modeling_highway_bert.py
- modeling_highway_roberta.py
- entropy_eval.sh
- eval_deebert.sh
- README.md
- requirements.txt
- run_glue_deebert.py
- test_glue_deebert.py
- train_deebert.sh
- binarized_data.py
- extract.py
- extract_distilbert.py
- token_counts.py
- distilbert-base-cased.json
- distilbert-base-multilingual-cased.json
- distilbert-base-uncased.json
- distilgpt2.json
- distilroberta-base.json
- distiller.py
- grouped_batch_sampler.py
- lm_seqs_dataset.py
- README.md
- requirements.txt
- run_squad_w_distillation.py
- train.py
- utils.py
- __init__.py
- model.py
- tokenizer_utils.py
- pyproject.toml
- README.md
- requirements.txt
- setup.py
- __init__.py
- igf.py
- README.md
- requirements.txt
- result_igf.png
- run_clm_igf.py
- bigbird_flax.py
- evaluate.py
- prepare_natural_questions.py
- README.md
- requirements.txt
- sweep_flax.yaml
- train.py
- README.md
- run_mlm_flax_stream.py
- configuration_hybrid_clip.py
- modeling_hybrid_clip.py
- README.md
- requirements.txt
- run_hybrid_clip.py
- partitions.py
- README.md
- run_clm_mp.py
- README.md
- run_wav2vec2_pretrain_flax.py
- HOW_TO_PROPOSE_PROJECT.md
- README.md
- README.md
- requirements.txt
- run_funsd_cord.py
- eli5_app.py
- eli5_utils.py
- README.md
- requirements.txt
- luke_utils.py
- README.md
- run_luke_ner_no_trainer.py
- demo.ipynb
- extracting_data.py
- modeling_frcnn.py
- processing_image.py
- README.md
- requirements.txt
- utils.py
- visualizing_image.py
- README.md
- requirements.txt
- run_chinese_ref.py
- run_mlm_wwm.py
- README.md
- run_mmimdb.py
- utils_mmimdb.py
- __init__.py
- binarizer.py
- masked_nn.py
- __init__.py
- configuration_bert_masked.py
- modeling_bert_masked.py
- bertarize.py
- counts_parameters.py
- masked_run_glue.py
- masked_run_squad.py
- README.md
- requirements.txt
- Saving_PruneBERT.ipynb
- generation_onnx.py
- reduce_onnx_size.py
- README.md
- requirements.txt
- run_onnx_exporter.py
- full_script.sh
- modeling_flax_performer.py
- modeling_flax_performer_utils.py
- README.md
- run_mlm_performer.py
- sanity_script.sh
- headfigure.png
- wooly.png
- pplm_classification_head.py
- README.md
- requirements.txt
- run_pplm.py
- run_pplm_discrim_train.py
- Dockerfile
- evaluate-hf-trt-qa.py
- ort-infer-benchmark.py
- quant_trainer.py
- README.md
- run_quant_qa.py
- trainer_quant_qa.py
- utils_qa.py
- my_knowledge_dataset.csv
- __init__.py
- _test_finetune_rag.py
- callbacks_rag.py
- consolidate_rag_checkpoint.py
- distributed_pytorch_retriever.py
- distributed_ray_retriever.py
- eval_rag.py
- finetune_rag.py
- finetune_rag.sh
- finetune_rag_ray.sh
- lightning_base.py
- parse_dpr_relevance_data.py
- README.md
- requirements.txt
- test_distributed_retriever.py
- use_own_knowledge_dataset.py
- utils_rag.py
- my_knowledge_dataset.csv
- test.source
- test.target
- train.source
- train.target
- val.source
- val.target
- test_finetune.sh
- test_rag_new_features.sh
- callbacks_rag.py
- distributed_ray_retriever.py
- eval_rag.py
- finetune_rag.py
- finetune_rag_ray_end2end.sh
- kb_encode_utils.py
- lightning_base.py
- README.md
- requirements.txt
- use_own_knowledge_dataset.py
- utils_rag.py
- eval.py
- README.md
- run_speech_recognition_ctc_bnb.py
- run_speech_recognition_ctc_streaming.py
- finetuning.py
- README.md
- requirements.txt
- run.sh
- selftraining.py
- _test_bash_script.py
- _test_make_student.py
- _test_seq2seq_examples.py
- _test_seq2seq_examples_multi_gpu.py
- callbacks.py
- convert_pl_checkpoint_to_hf.py
- distil_marian_enro_teacher.sh
- distil_marian_no_teacher.sh
- distillation.py
- dynamic_bs_example.sh
- finetune.py
- finetune.sh
- finetune_bart_tiny.sh
- finetune_pegasus_xsum.sh
- finetune_t5.sh
- lightning_base.py
- make_student.py
- precomputed_pseudo_labels.md
- README.md
- requirements.txt
- run_eval.py
- sentence_splitter.py
- train_distilbart_cnn.sh
- train_distilbart_xsum.sh
- train_mbart_cc25_enro.sh
- utils.py
- README.md
- requirements.txt
- run_tabfact_with_tapex.py
- run_wikisql_with_tapex.py
- run_wikitablequestions_with_tapex.py
- wikisql_utils.py
- demo.ipynb
- extracting_data.py
- modeling_frcnn.py
- processing_image.py
- README.md
- requirements.txt
- utils.py
- visualizing_image.py
- img_processing.py
- loaders.py
- README.md
- requirements.txt
- utils.py
- VQGAN_CLIP.py
- buckwalter.json
- alignment.py
- ds_config_wav2vec2_zero2.json
- ds_config_wav2vec2_zero3.json
- FINE_TUNE_XLSR_WAV2VEC2.md
- finetune_base_100.sh
- finetune_base_timit_asr.sh
- finetune_large_lv60_100.sh
- finetune_large_lv60_timit_asr.sh
- finetune_large_xlsr_53_arabic_speech_corpus.sh
- finetune_wav2vec2_xlsr_turkish.sh
- README.md
- requirements.txt
- run_alignment.sh
- run_asr.py
- run_common_voice.py
- run_pretrain.py
- test_wav2vec2_deepspeed.py
- README.md
- requirements.txt
- run_xtreme_s.py
- distill_classifier.py
- README.md
- README.md
- plot_csv_file.py
- README.md
- requirements.txt
- run_benchmark_tf.py
- README.md
- requirements.txt
- run_clip.py
- README.md
- requirements.txt
- run_image_classification.py
- README.md
- requirements.txt
- run_clm.py
- run_mlm.py
- prepare_tfrecord_shards.py
- README.md
- requirements.txt
- run_mlm.py
- train_unigram.py
- README.md
- requirements.txt
- run_swag.py
- README.md
- requirements.txt
- run_qa.py
- utils_qa.py
- README.md
- requirements.txt
- run_summarization.py
- README.md
- requirements.txt
- run_glue.py
- run_text_classification.py
- README.md
- requirements.txt
- run_ner.py
- README.md
- requirements.txt
- run_translation.py
- _tests_requirements.txt
- README.md
- test_tensorflow_examples.py
- README.md
- run_on_remote.py
- README.md
- README.md
- trainer-benchmark.py
- torch-distributed-gpu-test.py
- convert-allenai-wmt16.sh
- convert-allenai-wmt19.sh
- convert-facebook-wmt19.sh
- eval-allenai-wmt16.sh
- eval-allenai-wmt19.sh
- eval-facebook-wmt19.sh
- fsmt-make-super-tiny-model.py
- fsmt-make-tiny-model.py
- gen-card-allenai-wmt16.py
- gen-card-allenai-wmt19.py
- gen-card-facebook-wmt19.py
- s3-move.sh
- tests-to-run.sh
- build_test_sample_spm_no_bos.py
- README.md
- upload_models.sh
- check_tokenizers.py
- stale.py
- __init__.py
- benchmark.py
- benchmark_args.py
- benchmark_args_tf.py
- benchmark_args_utils.py
- benchmark_tf.py
- benchmark_utils.py
- __init__.py
- add_new_model.py
- add_new_model_like.py
- convert.py
- download.py
- env.py
- lfs.py
- pt_to_tf.py
- run.py
- serving.py
- train.py
- transformers_cli.py
- user.py
- __init__.py
- beam_constraints.py
- beam_search.py
- candidate_generator.py
- configuration_utils.py
- flax_logits_process.py
- flax_utils.py
- logits_process.py
- stopping_criteria.py
- streamers.py
- tf_logits_process.py
- tf_utils.py
- utils.py
- __init__.py
- awq.py
- bitsandbytes.py
- deepspeed.py
- integration_utils.py
- peft.py
- ms_deform_attn_cpu.cpp
- ms_deform_attn_cpu.h
- ms_deform_attn_cuda.cu
- ms_deform_attn_cuda.cuh
- ms_deform_attn_cuda.h
- ms_deform_im2col_cuda.cuh
- ms_deform_attn.h
- vision.cpp
- cuda_kernel.cu
- cuda_kernel.h
- cuda_launch.cu
- cuda_launch.h
- torch_extension.cpp
- wkv_cuda.cu
- wkv_cuda_bf16.cu
- wkv_op.cpp
- common.h
- common_cuda.h
- common_cuda_device.h
- fast_lsh_cumulation.cu
- fast_lsh_cumulation.h
- fast_lsh_cumulation_cuda.cu
- fast_lsh_cumulation_cuda.h
- fast_lsh_cumulation_torch.cpp
- __init__.py
- configuration_albert.py
- convert_albert_original_tf_checkpoint_to_pytorch.py
- modeling_albert.py
- modeling_flax_albert.py
- modeling_tf_albert.py
- tokenization_albert.py
- tokenization_albert_fast.py
- __init__.py
- configuration_align.py
- convert_align_tf_to_hf.py
- modeling_align.py
- processing_align.py
- __init__.py
- configuration_altclip.py
- modeling_altclip.py
- processing_altclip.py
- __init__.py
- configuration_audio_spectrogram_transformer.py
- convert_audio_spectrogram_transformer_original_to_pytorch.py
- feature_extraction_audio_spectrogram_transformer.py
- modeling_audio_spectrogram_transformer.py
- __init__.py
- auto_factory.py
- configuration_auto.py
- feature_extraction_auto.py
- image_processing_auto.py
- modeling_auto.py
- modeling_flax_auto.py
- modeling_tf_auto.py
- processing_auto.py
- tokenization_auto.py
- __init__.py
- configuration_autoformer.py
- modeling_autoformer.py
- __init__.py
- configuration_bark.py
- convert_suno_to_hf.py
- generation_configuration_bark.py
- modeling_bark.py
- processing_bark.py
- __init__.py
- configuration_bart.py
- convert_bart_original_pytorch_checkpoint_to_pytorch.py
- modeling_bart.py
- modeling_flax_bart.py
- modeling_tf_bart.py
- tokenization_bart.py
- tokenization_bart_fast.py
- __init__.py
- tokenization_barthez.py
- tokenization_barthez_fast.py
- __init__.py
- tokenization_bartpho.py
- __init__.py
- configuration_beit.py
- convert_beit_unilm_to_pytorch.py
- feature_extraction_beit.py
- image_processing_beit.py
- modeling_beit.py
- modeling_flax_beit.py
- __init__.py
- configuration_bert.py
- convert_bert_original_tf2_checkpoint_to_pytorch.py
- convert_bert_original_tf_checkpoint_to_pytorch.py
- convert_bert_pytorch_checkpoint_to_original_tf.py
- convert_bert_token_dropping_original_tf2_checkpoint_to_pytorch.py
- modeling_bert.py
- modeling_flax_bert.py
- modeling_tf_bert.py
- tokenization_bert.py
- tokenization_bert_fast.py
- tokenization_bert_tf.py
- __init__.py
- configuration_bert_generation.py
- modeling_bert_generation.py
- tokenization_bert_generation.py
- __init__.py
- tokenization_bert_japanese.py
- __init__.py
- tokenization_bertweet.py
- __init__.py
- configuration_big_bird.py
- convert_bigbird_original_tf_checkpoint_to_pytorch.py
- modeling_big_bird.py
- modeling_flax_big_bird.py
- tokenization_big_bird.py
- tokenization_big_bird_fast.py
- __init__.py
- configuration_bigbird_pegasus.py
- convert_bigbird_pegasus_tf_to_pytorch.py
- modeling_bigbird_pegasus.py
- __init__.py
- configuration_biogpt.py
- convert_biogpt_original_pytorch_checkpoint_to_pytorch.py
- modeling_biogpt.py
- tokenization_biogpt.py
- __init__.py
- configuration_bit.py
- convert_bit_to_pytorch.py
- image_processing_bit.py
- modeling_bit.py
- __init__.py
- configuration_blenderbot.py
- convert_blenderbot_original_pytorch_checkpoint_to_pytorch.py
- modeling_blenderbot.py
- modeling_flax_blenderbot.py
- modeling_tf_blenderbot.py
- tokenization_blenderbot.py
- tokenization_blenderbot_fast.py
- __init__.py
- configuration_blenderbot_small.py
- modeling_blenderbot_small.py
- modeling_flax_blenderbot_small.py
- modeling_tf_blenderbot_small.py
- tokenization_blenderbot_small.py
- tokenization_blenderbot_small_fast.py
- __init__.py
- configuration_blip.py
- convert_blip_original_pytorch_to_hf.py
- image_processing_blip.py
- modeling_blip.py
- modeling_blip_text.py
- modeling_tf_blip.py
- modeling_tf_blip_text.py
- processing_blip.py
- __init__.py
- configuration_blip_2.py
- convert_blip_2_original_to_pytorch.py
- modeling_blip_2.py
- processing_blip_2.py
- __init__.py
- configuration_bloom.py
- convert_bloom_original_checkpoint_to_pytorch.py
- modeling_bloom.py
- modeling_flax_bloom.py
- tokenization_bloom_fast.py
- __init__.py
- configuration_bridgetower.py
- image_processing_bridgetower.py
- modeling_bridgetower.py
- processing_bridgetower.py
- __init__.py
- configuration_bros.py
- convert_bros_to_pytorch.py
- modeling_bros.py
- processing_bros.py
- __init__.py
- convert_byt5_original_tf_checkpoint_to_pytorch.py
- tokenization_byt5.py
- __init__.py
- configuration_camembert.py
- modeling_camembert.py
- modeling_tf_camembert.py
- tokenization_camembert.py
- tokenization_camembert_fast.py
- __init__.py
- configuration_canine.py
- convert_canine_original_tf_checkpoint_to_pytorch.py
- modeling_canine.py
- tokenization_canine.py
- __init__.py
- configuration_chinese_clip.py
- convert_chinese_clip_original_pytorch_to_hf.py
- feature_extraction_chinese_clip.py
- image_processing_chinese_clip.py
- modeling_chinese_clip.py
- processing_chinese_clip.py
- __init__.py
- configuration_clap.py
- convert_clap_original_pytorch_to_hf.py
- feature_extraction_clap.py
- modeling_clap.py
- processing_clap.py
- __init__.py
- configuration_clip.py
- convert_clip_original_pytorch_to_hf.py
- feature_extraction_clip.py
- image_processing_clip.py
- modeling_clip.py
- modeling_flax_clip.py
- modeling_tf_clip.py
- processing_clip.py
- tokenization_clip.py
- tokenization_clip_fast.py
- __init__.py
- configuration_clipseg.py
- convert_clipseg_original_pytorch_to_hf.py
- modeling_clipseg.py
- processing_clipseg.py
- __init__.py
- configuration_clvp.py
- convert_clvp_to_hf.py
- feature_extraction_clvp.py
- modeling_clvp.py
- number_normalizer.py
- processing_clvp.py
- tokenization_clvp.py
- __init__.py
- tokenization_code_llama.py
- tokenization_code_llama_fast.py
- __init__.py
- configuration_codegen.py
- modeling_codegen.py
- tokenization_codegen.py
- tokenization_codegen_fast.py
- __init__.py
- configuration_conditional_detr.py
- convert_conditional_detr_original_pytorch_checkpoint_to_pytorch.py
- feature_extraction_conditional_detr.py
- image_processing_conditional_detr.py
- modeling_conditional_detr.py
- __init__.py
- configuration_convbert.py
- convert_convbert_original_tf1_checkpoint_to_pytorch_and_tf2.py
- modeling_convbert.py
- modeling_tf_convbert.py
- tokenization_convbert.py
- tokenization_convbert_fast.py
- __init__.py
- configuration_convnext.py
- convert_convnext_to_pytorch.py
- feature_extraction_convnext.py
- image_processing_convnext.py
- modeling_convnext.py
- modeling_tf_convnext.py
- __init__.py
- configuration_convnextv2.py
- convert_convnextv2_to_pytorch.py
- modeling_convnextv2.py
- modeling_tf_convnextv2.py
- __init__.py
- tokenization_cpm.py
- tokenization_cpm_fast.py
- __init__.py
- configuration_cpmant.py
- modeling_cpmant.py
- tokenization_cpmant.py
- __init__.py
- configuration_ctrl.py
- modeling_ctrl.py
- modeling_tf_ctrl.py
- tokenization_ctrl.py
- __init__.py
- configuration_cvt.py
- convert_cvt_original_pytorch_checkpoint_to_pytorch.py
- modeling_cvt.py
- modeling_tf_cvt.py
- __init__.py
- configuration_data2vec_audio.py
- configuration_data2vec_text.py
- configuration_data2vec_vision.py
- convert_data2vec_audio_original_pytorch_checkpoint_to_pytorch.py
- convert_data2vec_text_original_pytorch_checkpoint_to_pytorch.py
- convert_data2vec_vision_original_pytorch_checkpoint_to_pytorch.py
- modeling_data2vec_audio.py
- modeling_data2vec_text.py
- modeling_data2vec_vision.py
- modeling_tf_data2vec_vision.py
- __init__.py
- configuration_deberta.py
- modeling_deberta.py
- modeling_tf_deberta.py
- tokenization_deberta.py
- tokenization_deberta_fast.py
- __init__.py
- configuration_deberta_v2.py
- modeling_deberta_v2.py
- modeling_tf_deberta_v2.py
- tokenization_deberta_v2.py
- tokenization_deberta_v2_fast.py
- __init__.py
- configuration_decision_transformer.py
- modeling_decision_transformer.py
- __init__.py
- configuration_deformable_detr.py
- convert_deformable_detr_to_pytorch.py
- feature_extraction_deformable_detr.py
- image_processing_deformable_detr.py
- load_custom.py
- modeling_deformable_detr.py
- __init__.py
- configuration_deit.py
- convert_deit_timm_to_pytorch.py
- feature_extraction_deit.py
- image_processing_deit.py
- modeling_deit.py
- modeling_tf_deit.py
- __init__.py
- convert_bort_original_gluonnlp_checkpoint_to_pytorch.py
- __init__.py
- configuration_mctct.py
- feature_extraction_mctct.py
- modeling_mctct.py
- processing_mctct.py
- __init__.py
- configuration_mmbt.py
- modeling_mmbt.py
- __init__.py
- configuration_open_llama.py
- modeling_open_llama.py
- __init__.py
- configuration_retribert.py
- modeling_retribert.py
- tokenization_retribert.py
- tokenization_retribert_fast.py
- __init__.py
- tokenization_tapex.py
- __init__.py
- configuration_trajectory_transformer.py
- convert_trajectory_transformer_original_pytorch_checkpoint_to_pytorch.py
- modeling_trajectory_transformer.py
- __init__.py
- configuration_transfo_xl.py
- convert_transfo_xl_original_tf_checkpoint_to_pytorch.py
- modeling_tf_transfo_xl.py
- modeling_tf_transfo_xl_utilities.py
- modeling_transfo_xl.py
- modeling_transfo_xl_utilities.py
- tokenization_transfo_xl.py
- __init__.py
- configuration_van.py
- convert_van_to_pytorch.py
- modeling_van.py
- __init__.py
- __init__.py
- configuration_deta.py
- convert_deta_resnet_to_pytorch.py
- convert_deta_swin_to_pytorch.py
- image_processing_deta.py
- modeling_deta.py
- __init__.py
- configuration_detr.py
- convert_detr_original_pytorch_checkpoint_to_pytorch.py
- convert_detr_to_pytorch.py
- feature_extraction_detr.py
- image_processing_detr.py
- modeling_detr.py
- __init__.py
- convert_dialogpt_original_pytorch_checkpoint_to_pytorch.py
- __init__.py
- configuration_dinat.py
- modeling_dinat.py
- __init__.py
- configuration_dinov2.py
- convert_dinov2_to_hf.py
- modeling_dinov2.py
- __init__.py
- configuration_distilbert.py
- modeling_distilbert.py
- modeling_flax_distilbert.py
- modeling_tf_distilbert.py
- tokenization_distilbert.py
- tokenization_distilbert_fast.py
- __init__.py
- convert_dit_unilm_to_pytorch.py
- __init__.py
- configuration_donut_swin.py
- convert_donut_to_pytorch.py
- feature_extraction_donut.py
- image_processing_donut.py
- modeling_donut_swin.py
- processing_donut.py
- __init__.py
- configuration_dpr.py
- convert_dpr_original_checkpoint_to_pytorch.py
- modeling_dpr.py
- modeling_tf_dpr.py
- tokenization_dpr.py
- tokenization_dpr_fast.py
- __init__.py
- configuration_dpt.py
- convert_dinov2_depth_to_hf.py
- convert_dpt_beit_to_hf.py
- convert_dpt_hybrid_to_pytorch.py
- convert_dpt_to_pytorch.py
- feature_extraction_dpt.py
- image_processing_dpt.py
- modeling_dpt.py
- __init__.py
- configuration_efficientformer.py
- convert_efficientformer_original_pytorch_checkpoint_to_pytorch.py
- image_processing_efficientformer.py
- modeling_efficientformer.py
- modeling_tf_efficientformer.py
- __init__.py
- configuration_efficientnet.py
- convert_efficientnet_to_pytorch.py
- image_processing_efficientnet.py
- modeling_efficientnet.py
- __init__.py
- configuration_electra.py
- convert_electra_original_tf_checkpoint_to_pytorch.py
- modeling_electra.py
- modeling_flax_electra.py
- modeling_tf_electra.py
- tokenization_electra.py
- tokenization_electra_fast.py
- __init__.py
- configuration_encodec.py
- convert_encodec_checkpoint_to_pytorch.py
- feature_extraction_encodec.py
- modeling_encodec.py
- __init__.py
- configuration_encoder_decoder.py
- modeling_encoder_decoder.py
- modeling_flax_encoder_decoder.py
- modeling_tf_encoder_decoder.py
- __init__.py
- configuration_ernie.py
- modeling_ernie.py
- __init__.py
- configuration_ernie_m.py
- modeling_ernie_m.py
- tokenization_ernie_m.py
- __init__.py
- chunk_utils.py
- data_transforms.py
- feats.py
- loss.py
- protein.py
- residue_constants.py
- rigid_utils.py
- tensor_utils.py
- __init__.py
- configuration_esm.py
- convert_esm.py
- modeling_esm.py
- modeling_esmfold.py
- modeling_tf_esm.py
- tokenization_esm.py
- __init__.py
- configuration_falcon.py
- convert_custom_code_checkpoint.py
- modeling_falcon.py
- __init__.py
- configuration_flaubert.py
- modeling_flaubert.py
- modeling_tf_flaubert.py
- tokenization_flaubert.py
- __init__.py
- configuration_flava.py
- convert_dalle_to_flava_codebook.py
- convert_flava_original_pytorch_to_hf.py
- feature_extraction_flava.py
- image_processing_flava.py
- modeling_flava.py
- processing_flava.py
- __init__.py
- configuration_fnet.py
- convert_fnet_original_flax_checkpoint_to_pytorch.py
- modeling_fnet.py
- tokenization_fnet.py
- tokenization_fnet_fast.py
- __init__.py
- configuration_focalnet.py
- convert_focalnet_to_hf_format.py
- modeling_focalnet.py
- __init__.py
- configuration_fsmt.py
- convert_fsmt_original_pytorch_checkpoint_to_pytorch.py
- modeling_fsmt.py
- tokenization_fsmt.py
- __init__.py
- configuration_funnel.py
- convert_funnel_original_tf_checkpoint_to_pytorch.py
- modeling_funnel.py
- modeling_tf_funnel.py
- tokenization_funnel.py
- tokenization_funnel_fast.py
- __init__.py
- configuration_fuyu.py
- convert_fuyu_model_weights_to_hf.py
- image_processing_fuyu.py
- modeling_fuyu.py
- processing_fuyu.py
- __init__.py
- configuration_git.py
- convert_git_to_pytorch.py
- modeling_git.py
- processing_git.py
- __init__.py
- configuration_glpn.py
- convert_glpn_to_pytorch.py
- feature_extraction_glpn.py
- image_processing_glpn.py
- modeling_glpn.py
- __init__.py
- configuration_gpt2.py
- CONVERSION.md
- convert_gpt2_original_tf_checkpoint_to_pytorch.py
- modeling_flax_gpt2.py
- modeling_gpt2.py
- modeling_tf_gpt2.py
- tokenization_gpt2.py
- tokenization_gpt2_fast.py
- tokenization_gpt2_tf.py
- __init__.py
- configuration_gpt_bigcode.py
- modeling_gpt_bigcode.py
- __init__.py
- configuration_gpt_neo.py
- convert_gpt_neo_mesh_tf_to_pytorch.py
- modeling_flax_gpt_neo.py
- modeling_gpt_neo.py
- __init__.py
- configuration_gpt_neox.py
- modeling_gpt_neox.py
- tokenization_gpt_neox_fast.py
- __init__.py
- configuration_gpt_neox_japanese.py
- modeling_gpt_neox_japanese.py
- tokenization_gpt_neox_japanese.py
- __init__.py
- convert_megatron_to_pytorch.py
- tokenization_gpt_sw3.py
- __init__.py
- configuration_gptj.py
- modeling_flax_gptj.py
- modeling_gptj.py
- modeling_tf_gptj.py
- __init__.py
- configuration_gptsan_japanese.py
- convert_gptsan_tf_checkpoint_to_pytorch.py
- modeling_gptsan_japanese.py
- tokenization_gptsan_japanese.py
- __init__.py
- algos_graphormer.pyx
- collating_graphormer.py
- configuration_graphormer.py
- modeling_graphormer.py
- __init__.py
- configuration_groupvit.py
- convert_groupvit_nvlab_to_hf.py
- modeling_groupvit.py
- modeling_tf_groupvit.py
- __init__.py
- tokenization_herbert.py
- tokenization_herbert_fast.py
- __init__.py
- configuration_hubert.py
- convert_distilhubert_original_s3prl_checkpoint_to_pytorch.py
- convert_hubert_original_pytorch_checkpoint_to_pytorch.py
- convert_hubert_original_s3prl_checkpoint_to_pytorch.py
- modeling_hubert.py
- modeling_tf_hubert.py
- __init__.py
- configuration_ibert.py
- modeling_ibert.py
- quant_modules.py
- __init__.py
- configuration_idefics.py
- image_processing_idefics.py
- modeling_idefics.py
- perceiver.py
- processing_idefics.py
- vision.py
- __init__.py
- configuration_imagegpt.py
- convert_imagegpt_original_tf2_to_pytorch.py
- feature_extraction_imagegpt.py
- image_processing_imagegpt.py
- modeling_imagegpt.py
- __init__.py
- configuration_informer.py
- modeling_informer.py
- __init__.py
- configuration_instructblip.py
- convert_instructblip_original_to_pytorch.py
- modeling_instructblip.py
- processing_instructblip.py
- __init__.py
- configuration_jukebox.py
- convert_jukebox.py
- modeling_jukebox.py
- tokenization_jukebox.py
- __init__.py
- configuration_kosmos2.py
- convert_kosmos2_original_pytorch_checkpoint_to_pytorch.py
- modeling_kosmos2.py
- processing_kosmos2.py
- __init__.py
- configuration_layoutlm.py
- modeling_layoutlm.py
- modeling_tf_layoutlm.py
- tokenization_layoutlm.py
- tokenization_layoutlm_fast.py
- __init__.py
- configuration_layoutlmv2.py
- feature_extraction_layoutlmv2.py
- image_processing_layoutlmv2.py
- __init__.py
- __init__.py
- activations.py
- activations_tf.py
- audio_utils.py
- cache_utils.py
- configuration_utils.py
- convert_graph_to_onnx.py
- convert_pytorch_checkpoint_to_tf2.py
- convert_slow_tokenizer.py
- convert_slow_tokenizers_checkpoints_to_fast.py
- convert_tf_hub_seq_to_seq_bert_to_pytorch.py
- debug_utils.py
- deepspeed.py
- dependency_versions_check.py
- dependency_versions_table.py
- dynamic_module_utils.py
- feature_extraction_sequence_utils.py
- feature_extraction_utils.py
- file_utils.py
- generation_flax_utils.py
- generation_tf_utils.py
- generation_utils.py
- hf_argparser.py
- hyperparameter_search.py
- image_processing_utils.py
- image_transforms.py
- image_utils.py
- keras_callbacks.py
- modelcard.py
- modeling_attn_mask_utils.py
- modeling_flax_outputs.py
- modeling_flax_pytorch_utils.py
- modeling_flax_utils.py
- modeling_outputs.py
- modeling_tf_outputs.py
- modeling_tf_pytorch_utils.py
- modeling_tf_utils.py
- modeling_utils.py
- .coveragerc
- .gitattributes
- .gitignore
- awesome-transformers.md
- CITATION.cff
- CODE_OF_CONDUCT.md
- conftest.py
- CONTRIBUTING.md
- hubconf.py
- ISSUES.md
- LICENSE
- Makefile
- pyproject.toml
- README.md
- README_es.md
- README_hd.md
- README_ja.md
- README_ko.md
- README_pt-br.md
- README_ru.md
- README_te.md
- README_zh-hans.md
- README_zh-hant.md
- SECURITY.md
- setup.py
- .gitignore
- causal_tracing_comparison.py
- causal_tracing_composition.py
- comparison.ipynb
- complex_reasoning.ipynb
- composition.ipynb
- eval_qa.py
- LICENSE
- LLM.ipynb
- main.py
- README.md
# Installation Guide
git clone https://github.com/OSU-NLP-Group/GrokkedTransformer
Downloads the entire project code from GitHub to your computer.
cd GrokkedTransformer
Moves into the project folder you just downloaded.
2. Official Install Script
Easy Recommended- Python 3 Python is required to use pip.
pip install torch==1.13.1+cu116 torchvision==0.14.1+cu116 torchaudio==0.13.1 --extra-index-url https://download.pytorch.org/whl/cu116
Installs the package published on PyPI directly β no need to clone the source.
Pulled directly from this repo's README.
3. Docker
Easy- Git Needed to download the project code from GitHub.
- Docker Desktop Needed to build and run containers. Install it and keep it running in the background.
docker build -f transformers/docker/transformers-all-latest-gpu/Dockerfile -t grokkedtransformer .
Builds a runnable image based on the Dockerfile.
docker run -p 8080:80 grokkedtransformer
Runs the built image as an actual container.
4. Python
Easypip install torch==1.13.1+cu116 torchvision==0.14.1+cu116 torchaudio==0.13.1 --extra-index-url https://download.pytorch.org/whl/cu116
Installs the package published on PyPI directly β no need to clone the source.
pip install -e .
Installs the Python libraries listed in requirements.txt (or similar).
Pulled directly from this repo's README.
5. Make
Medium- Git Needed to download the project code from GitHub.
- Make Usually pre-installed on Linux/macOS. On Windows, install separately (e.g. via MSYS2 or WSL).
cd simpletransformers
This project's files live in a subfolder, so move into it first.
make
Compiles the code based on the generated build configuration to produce an executable.
