{"as_of":"2026-08-17T23:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:589f8a749db1567c9862b5d05be4dcd78a6012a931bbe351999bab7fed85a180","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:50:24.303188Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13364/citation-record","integrity":"/paper/2507.13364/integrity","json":"/paper/2507.13364/citation-record.json","paper":"/paper/2507.13364"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.223191Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.223191Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ddd75114a99523fe59a3de2a63f3b7a69cfa5b7496bf8bcecb6fbe21c5d4d4cd","observation_id":"d59a1872-489d-4553-9de4-41191b6890f5","resolution":{"observed_at":"2026-08-06T19:50:14.223191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.301171Z","title":"Objects that sound","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.301171Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8e845f31076a1bd42b7f08e65a7944b8b5f6f8dd9cf1264b611529e9e2e629ad","observation_id":"58c6bae3-fdc2-4237-8b13-d67425b5116f","resolution":{"observed_at":"2026-08-06T19:50:14.301171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.441879Z","title":"3d seman- tic parsing of large-scale indoor spaces","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.441879Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d3f89ee8dd12eca1fbd1d183a71d5382b62786a3ec4ee3e4b9cdf367e65209d2","observation_id":"af1c03c2-eed2-4c63-8061-3e9de9304f1e","resolution":{"observed_at":"2026-08-06T19:50:14.441879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16691","last_updated":"2022-03-30T22:06:13Z","snapshot_observed_at":"2026-08-16T17:10:25.582710Z","submitted_at":"2022-03-30T22:06:13Z","title":"MAE-AST: Masked Autoencoding Audio Spectrogram Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16691","snapshot_observed_at":"2026-08-06T19:50:14.572549Z","title":"Mae- ast: Masked autoencoding audio spectrogram transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.572549Z"},"links":{"cited_paper":"/paper/2203.16691","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:bc99456ab1d62570b06515b4d3f7d40a16bbe1e85f3971cda36f7a4977e95c1d","observation_id":"39d3b6b5-846b-49fd-87e5-30dc0c0f116b","resolution":{"observed_at":"2026-08-06T19:50:14.572549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.702418Z","title":"Data2vec: A general frame- work for self-supervised learning in speech, vision and lan- guage","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.702418Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:369d8b625af20ebbc36aedd1cfa2f263e11282bcd2e74bdf5289a4fbf626fd60","observation_id":"a21ca1f0-fa77-4a38-b1f9-6cd59471f3d0","resolution":{"observed_at":"2026-08-06T19:50:14.702418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.854860Z","title":"Generative adversarial networks based on transformer encoder and convolution block for hyperspectral image classification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.854860Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:4eae4d3d6473e41e561dc12b3af3644de2ca7fdc741d9b65ef1c451fe17917aa","observation_id":"2bea425a-ac9b-44e4-8ad7-d70b29a3bf8d","resolution":{"observed_at":"2026-08-06T19:50:14.854860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10890","last_updated":"2022-11-03T18:34:02Z","snapshot_observed_at":"2026-08-16T17:19:31.295522Z","submitted_at":"2022-02-22T13:39:14Z","title":"HiP: Hierarchical Perceiver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10890","snapshot_observed_at":"2026-08-06T19:50:14.988580Z","title":"Hierarchical perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.988580Z"},"links":{"cited_paper":"/paper/2202.10890","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2917d711409a0b4de3870f0aef092cba4084d6f8141310e9ec998e940887cf2c","observation_id":"3c461085-a472-455b-901b-a4c5fd5b9a5b","resolution":{"observed_at":"2026-08-06T19:50:14.988580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:15.091237Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.091237Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:50f5b6d73a669182d687707a4526887cac1e32fbd79f926ff7e01a098616be07","observation_id":"56e36f43-8424-40ea-a6a1-99d718592339","resolution":{"observed_at":"2026-08-06T19:50:15.091237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06762","last_updated":"2021-06-16T06:34:42Z","snapshot_observed_at":"2026-08-16T18:24:45.131069Z","submitted_at":"2021-05-14T11:12:40Z","title":"DialogSum: A Real-Life Scenario Dialogue Summarization Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06762","snapshot_observed_at":"2026-08-06T19:50:15.207070Z","title":"Dialogsum: A real-life scenario dialogue summarization dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.207070Z"},"links":{"cited_paper":"/paper/2105.06762","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:94e5b47240fda6493fdd0d373555fd9163182eebf23e32dfe5b6908d5d9b6db6","observation_id":"54ea8e34-ffa0-4245-9962-ef434d3f3ae7","resolution":{"observed_at":"2026-08-06T19:50:15.207070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09796","last_updated":"2020-09-10T19:31:04Z","snapshot_observed_at":"2026-08-09T08:30:49.737024Z","submitted_at":"2020-09-10T19:31:04Z","title":"Multi-Task Learning with Deep Neural Networks: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09796","snapshot_observed_at":"2026-08-06T19:50:15.356316Z","title":"Multi-task learning with deep neu- ral networks: A survey","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.356316Z"},"links":{"cited_paper":"/paper/2009.09796","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:62635c95c083c92d3336ae93fae2ccfce66c51e73c1a8e5a6683c114c4be12f7","observation_id":"c5a18620-9c84-4893-8dc8-db6d1adb2641","resolution":{"observed_at":"2026-08-06T19:50:15.356316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06126","last_updated":"2022-05-12T14:39:21Z","snapshot_observed_at":"2026-08-16T17:00:46.272100Z","submitted_at":"2022-05-12T14:39:21Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","version":1},"cited_work":{"arxiv_id":"2205.06126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.06126","snapshot_observed_at":"2026-08-06T19:50:26.429204Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","venue":"cs.CL","work_id":"a6ffbe8f-5c9e-4dcd-afc2-7f45cf4e9789","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.468308Z"},"links":{"cited_paper":"/paper/2205.06126","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:24e56b18c976d99be0467a3ea064147b25cef33ad24f059ca84a678bbc6f17f2","observation_id":"56770bc8-7652-4291-a236-385ac86ae989","resolution":{"observed_at":"2026-08-06T19:50:26.526503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:15.576775Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.576775Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:794c1c2df8105f360f844029fad64e5ae5b42e449d14f872fb45fb71f6a8dc7b","observation_id":"9f3f72e0-b581-414b-8320-fc49d0f25b45","resolution":{"observed_at":"2026-08-06T19:50:15.576775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:15.745612Z","title":"BERT: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.745612Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:0375ea68a1851bf6ac9a2c1d284561ae0618cf3a3e1235553550fa34650a7cdd","observation_id":"fd8e2161-2dab-474d-aafc-305379b80e06","resolution":{"observed_at":"2026-08-06T19:50:15.745612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:50:15.911782Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.911782Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:84bc621d1e58863c2d79ac6c76723e8ce6ecd2a6e191769b6fa3617b8a76ff95","observation_id":"37f95f8a-075d-45ee-b344-173b91ad14b3","resolution":{"observed_at":"2026-08-06T19:50:15.911782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.035240Z","title":"A generaliza- tion of transformer networks to graphs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.035240Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:1c01835f3f049ea2c6fe2b68362c9b8f5ef21b9a73c3d0f12317cc4830e4d655","observation_id":"55f8eeca-e4a0-4882-b8a4-0aead2363c93","resolution":{"observed_at":"2026-08-06T19:50:16.035240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.197878Z","title":"Efficiently identifying task group- ings for multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.197878Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:0e44aec1b029a6ab10653838415df351b681d6c75f271055a4d55c2a08618cc8","observation_id":"dc85f918-01e8-42ac-9e37-65f9d313ef58","resolution":{"observed_at":"2026-08-06T19:50:16.197878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11479","last_updated":"2022-07-05T06:30:51Z","snapshot_observed_at":"2026-08-16T17:04:53.071811Z","submitted_at":"2022-04-25T07:50:45Z","title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.11479","snapshot_observed_at":"2026-08-06T19:50:16.324991Z","title":"End-to-end audio strikes back: Boosting augmentations towards an efficient audio classification net- work","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.324991Z"},"links":{"cited_paper":"/paper/2204.11479","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e7ea742ebe8e76efdfa8e4ff04f191286ba0b2392c666ae0b5237a2420954a0c","observation_id":"dae79af5-b80a-4199-8116-20bd3ce75789","resolution":{"observed_at":"2026-08-06T19:50:16.324991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.490217Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.490217Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b94d180d089e2d4b11388770c938476219cc2563c5323b6bdae4cc037ecbd99b","observation_id":"d9b07949-7982-4622-b307-34c03a5d24c0","resolution":{"observed_at":"2026-08-06T19:50:16.490217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08356","last_updated":"2023-05-31T04:53:11Z","snapshot_observed_at":"2026-08-16T16:52:27.244180Z","submitted_at":"2022-06-16T17:57:01Z","title":"OmniMAE: Single Model Masked Pretraining on Images and Videos","version":2},"cited_work":{"arxiv_id":"2206.08356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08356","snapshot_observed_at":"2026-08-06T19:50:26.208474Z","title":"OmniMAE: Single Model Masked Pretraining on Images and Videos","venue":"cs.CV","work_id":"b40ace85-c248-4a2c-9cb0-0297eae31e31","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.598120Z"},"links":{"cited_paper":"/paper/2206.08356","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:52291bb72b7650ac39d7e5697ce5185a1354c9dced8413ccf6fcdfc022a118e3","observation_id":"932aad78-8e47-4db1-aeef-9cf77236476d","resolution":{"observed_at":"2026-08-06T19:50:26.285243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.711982Z","title":"Omni- vore: A single model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.711982Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b71e1efaf3dfe07a09645d80653e9e92a922119998df52d3c44ed8a21b632e65","observation_id":"f09ffe82-9b83-4d02-aef9-ae2198364411","resolution":{"observed_at":"2026-08-06T19:50:16.711982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-16T21:53:06.200582Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-08-06T19:50:16.915486Z","title":"Samsum corpus: A human-annotated dia- logue dataset for abstractive summarization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.915486Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8a5da00b78c312d667cf93cc781f69f08842bb91d464622a024a6f9dd2365c8e","observation_id":"475ea48a-1140-4d20-9ed5-3805e5e0fc1e","resolution":{"observed_at":"2026-08-06T19:50:16.915486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-16T18:33:54.408269Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T19:50:17.039560Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.039560Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:aaf1672cd168d6a68a8fcec4f623cc089a1faf59acc2abc08072b43f4a122adc","observation_id":"c5ee46f4-7d1b-482f-8cad-1e106d61c0a3","resolution":{"observed_at":"2026-08-06T19:50:17.039560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.202842Z","title":"Uavm: Towards unifying audio and visual models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.202842Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:1af8f62e893752c37aec7fd09c7fe7950c9e06a394cbc46cf3da4aca216e6cec","observation_id":"e59a712b-21b1-4fb7-81b0-22fb95d4f43f","resolution":{"observed_at":"2026-08-06T19:50:17.202842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.322899Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.322899Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d9e56d35b5f2036b620003219dcfc0185593ab09ea8d4f3108e0ddb54adff949","observation_id":"1ef8eb6e-cdb5-41bb-9fbe-0567c56ac70e","resolution":{"observed_at":"2026-08-06T19:50:17.322899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.420096Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.420096Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:60454bfc01a10df4e106eb063649f61a8cb5016e9cb45494b7d961e1e2c71e6c","observation_id":"4684aabb-05a1-438c-b075-9b2859961c47","resolution":{"observed_at":"2026-08-06T19:50:17.420096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.507498Z","title":"Dynamic task prioritization for multitask learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.507498Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:7007431248efe705970c0860b51d0e3f1db17c7c79bb50755ba05f77a696db48","observation_id":"718fe2f5-fe32-4d5c-84fc-5ac5709e6bdf","resolution":{"observed_at":"2026-08-06T19:50:17.507498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-16T16:50:48.383558Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-06T19:50:17.617134Z","title":"Maskvit: Masked vi- sual pre-training for video prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.617134Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:292287a8a4ce2906a0cc4fa386e9ce988bcf592a9b883d1e7b7a4a0297a993d4","observation_id":"87e16809-6d0e-4eda-b546-ff98c30ed626","resolution":{"observed_at":"2026-08-06T19:50:17.617134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.712917Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.712917Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:1fe7888b64881612929ef98f8dfad51ae93d77a3a6df89559070a7f14050186c","observation_id":"e0b9e3d5-d3ef-4db0-92b5-c89935dbf407","resolution":{"observed_at":"2026-08-06T19:50:17.712917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T19:50:17.826839Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.826839Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:5fbd7b86cf8526621ce447033fd76ef8e62b676d93f87d8ece0dba85ea70539f","observation_id":"0a79934a-741c-4e41-b197-0f059c137274","resolution":{"observed_at":"2026-08-06T19:50:17.826839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.932549Z","title":"Spectral- former: Rethinking hyperspectral image classification with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.932549Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ed43e5939ad04b7d9d58001f689d6c11bc4d13e262cb037040caa735e8f9be8a","observation_id":"1f89a59d-b2a3-4f03-bbb4-dad5dfd4add6","resolution":{"observed_at":"2026-08-06T19:50:17.932549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.021377Z","title":"Unit: Multimodal multitask learning with a unified transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.021377Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2cac1d7e9bb93792c4a4b2a3891d92470ba537157b305d10d2d2d64464103e58","observation_id":"621186a5-ba8c-416d-8ff9-bd93cdde9a52","resolution":{"observed_at":"2026-08-06T19:50:18.021377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.09430","last_updated":"2021-10-20T22:40:40Z","snapshot_observed_at":"2026-08-16T18:38:23.179403Z","submitted_at":"2021-03-17T04:08:03Z","title":"OGB-LSC: A Large-Scale Challenge for Machine Learning on Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.09430","snapshot_observed_at":"2026-08-06T19:50:18.119583Z","title":"Ogb-lsc: A large-scale challenge for machine learning on graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.119583Z"},"links":{"cited_paper":"/paper/2103.09430","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:81dbc22ec2b09959e76c6294a35df7b2cac647704f15487bfa8f8483f046a8a7","observation_id":"84660675-7b4b-4f5c-82f4-da2d19e23c2c","resolution":{"observed_at":"2026-08-06T19:50:18.119583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-06T19:50:18.251387Z","title":"Perceiver io: A general architec- ture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.251387Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:bac28491ef48c9729bedb38780dd862e0666019ed8631170da53cb287b18a006","observation_id":"342a32dc-600d-4380-a433-3c3e8138eded","resolution":{"observed_at":"2026-08-06T19:50:18.251387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.379108Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.379108Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:430479372ca373cd00eaa570eaa60840958fbee53e67f987bbf0a817d81c07bb","observation_id":"a5d0eb73-3086-4f59-aead-67f1a0556924","resolution":{"observed_at":"2026-08-06T19:50:18.379108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.514139Z","title":"A review of multimodal image matching: Methods and applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.514139Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:01520f30d00576d55a358ca9e51a6169d607a2f40a9c8f9e76d50251bd0472f3","observation_id":"9d9f546e-fc24-4b2c-89fc-3a190f2f92bb","resolution":{"observed_at":"2026-08-06T19:50:18.514139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05137","last_updated":"2017-06-16T03:10:03Z","snapshot_observed_at":"2026-08-14T20:53:41.671424Z","submitted_at":"2017-06-16T03:10:03Z","title":"One Model To Learn Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05137","snapshot_observed_at":"2026-08-06T19:50:18.598502Z","title":"One model to learn them all","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.598502Z"},"links":{"cited_paper":"/paper/1706.05137","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:6ccb2534d582bbf8ecc391321119108b93bee88750be0bace8f9cb823d7eb17b","observation_id":"9cd1fe4c-4482-434f-b3e5-f327b37fc8f1","resolution":{"observed_at":"2026-08-06T19:50:18.598502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T19:50:18.711195Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.711195Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:686401662fae508d864a3fe0e743a441abc8992ba1c9449b185da43797e1a797","observation_id":"2c9ea7e5-0131-4774-9b13-11500b736714","resolution":{"observed_at":"2026-08-06T19:50:18.711195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00930","last_updated":"2022-09-02T10:08:28Z","snapshot_observed_at":"2026-08-16T16:35:09.977453Z","submitted_at":"2022-09-02T10:08:28Z","title":"Mind the Gap! Injecting Commonsense Knowledge for Abstractive Dialogue Summarization","version":1},"cited_work":{"arxiv_id":"2209.00930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.00930","snapshot_observed_at":"2026-08-06T19:50:25.884969Z","title":"Mind the Gap! Injecting Commonsense Knowledge for Abstractive Dialogue Summarization","venue":"cs.CL","work_id":"7ab7cb15-1f15-4ccc-a69e-307a4bd0d738","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.839182Z"},"links":{"cited_paper":"/paper/2209.00930","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:dbe022b008985dcbcf7b2ee1b9fb531cb17d8108e4c93608ec61e936a07c5f91","observation_id":"30d3f7e6-cc88-430e-8730-dc40862b5df6","resolution":{"observed_at":"2026-08-06T19:50:25.963938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.937345Z","title":"Re- former: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.937345Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:6d7f57d71a44ce247e40fe42035b3f7c94c069237ef3984e40090f526b3ccab3","observation_id":"0b31472a-8eda-49b8-9476-252fb415548f","resolution":{"observed_at":"2026-08-06T19:50:18.937345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:19.051884Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.051884Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:62e2d38212a18686e592d7e304792f8b9a2cee87910a506c4d6e7d787f603bdf","observation_id":"e7b145c0-c1a0-4ea9-b71c-f24d22135333","resolution":{"observed_at":"2026-08-06T19:50:19.051884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:19.166703Z","title":"Modeling long-and short-term temporal patterns with deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.166703Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2b9b9d3db674aa86def42479f31d31a5e6e11ef076e42e0428d4a40f2c6f504e","observation_id":"1345fdee-e667-447e-8af6-ab88c4dd7d26","resolution":{"observed_at":"2026-08-06T19:50:19.166703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:19.290419Z","title":"Stratified trans- former for 3d point cloud segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.290419Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:4b9d54e8820b136ae2eef2aa4028803fd96667d85f36786cfd5a9a8c3e306d3f","observation_id":"2b5de6d7-497d-47c5-9c91-c72f11041bf1","resolution":{"observed_at":"2026-08-06T19:50:19.290419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:32.232989Z","title":"Regu- larization strategy for point cloud via rigidly mixed sample","venue":null,"work_id":"8bf5f4fe-f34c-4a1a-bafd-5492f9fea05f","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.428323Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e5e6183e7c8ab9587c03c9ac14e684e34c8a806b3150ee9045b5fb174cb79b8d","observation_id":"6230888b-edf8-4947-8121-8823afc854e5","resolution":{"observed_at":"2026-08-06T19:50:32.311366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:32.216266Z","title":"Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":"a6f65758-6e4d-4945-94f3-64c00ac3e98e","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.541910Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:efaf560979f6b099815d083909411633e53ae3e61c73fe7d023603ee960cd925","observation_id":"1d5913ce-11ba-4c0d-8c9e-28202a97a75c","resolution":{"observed_at":"2026-08-06T19:50:32.222632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09552","last_updated":"2022-11-17T14:17:40Z","snapshot_observed_at":"2026-08-16T16:15:23.573281Z","submitted_at":"2022-11-17T14:17:40Z","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09552","snapshot_observed_at":"2026-08-06T19:50:19.646948Z","title":"Uniformerv2: Spatiotemporal learning by arming image vits with video uniformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.646948Z"},"links":{"cited_paper":"/paper/2211.09552","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:fa859ef2ddf80ae71b4d3965d9bd4b4eccfefbe9e8e45c202f989035cca9e467","observation_id":"f1a474c0-6c44-45d3-9420-44286c7b83b3","resolution":{"observed_at":"2026-08-06T19:50:19.646948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.996835Z","title":"Enhancing the locality and breaking the memory bottleneck of transformer on time series forecasting","venue":null,"work_id":"caf738a1-98b7-4c9d-95ac-42d31f9d8117","year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.768028Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:dfc74e51840264cebccf23ff66ff6fb594f46f16d5f53c4f4c84fd5bb2e4a037","observation_id":"941ae255-0a70-4627-8651-0196319e1ce4","resolution":{"observed_at":"2026-08-06T19:50:32.074110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02053","last_updated":"2022-10-19T20:39:13Z","snapshot_observed_at":"2026-08-16T17:17:05.021289Z","submitted_at":"2022-03-03T22:53:54Z","title":"Mind the Gap: Understanding the Modality Gap in Multi-modal Contrastive Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02053","snapshot_observed_at":"2026-08-06T19:50:19.855755Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.855755Z"},"links":{"cited_paper":"/paper/2203.02053","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2c24cc6241e988d774a5a644610aeddf5d7f7d8f52b15887f43c62b94a43c406","observation_id":"9a8f0407-498c-4677-afa6-5800b0e5c46b","resolution":{"observed_at":"2026-08-06T19:50:19.855755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.779084Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"53906636-999d-4b2f-b96e-e6d938046bc0","year":2014},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.953525Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:bfb271ab5d4afea52bc6fc7b29a47a8afc47a07d4bbfc1d5a124b9c8ff31597d","observation_id":"df00d131-ea42-45f1-bd8c-76ec203b2e1c","resolution":{"observed_at":"2026-08-06T19:50:31.892880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00249","last_updated":"2021-07-06T03:18:27Z","snapshot_observed_at":"2026-08-17T03:02:11.576367Z","submitted_at":"2021-07-01T06:59:44Z","title":"OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2107.00249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.00249","snapshot_observed_at":"2026-08-06T19:50:25.696245Z","title":"OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation","venue":"cs.CV","work_id":"15529c78-9434-4436-99cf-48b3ecea8821","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.051811Z"},"links":{"cited_paper":"/paper/2107.00249","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:4c03d068c0a2134b64182de0e328b0706da101799c1c4372c6476137094fdfff","observation_id":"56008d9f-43a8-4667-b043-2ab6eeb4e977","resolution":{"observed_at":"2026-08-06T19:50:25.761552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.591767Z","title":"Pyraformer: Low- complexity pyramidal attention for long-range time series modeling and forecasting","venue":null,"work_id":"945f16cb-8309-4ee8-aa5e-2c78c5f8e175","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.168295Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2ec2e43f4013a3c1ef1fc034cda2e9aca423fb87b21c83af027dbcd8ac1a27d5","observation_id":"8f652af2-877d-4b29-90cc-df16bbcac204","resolution":{"observed_at":"2026-08-06T19:50:31.679062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T19:50:20.304795Z","title":"Roberta: A ro- bustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.304795Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9e5c691eb8857621dc14661041a71bc4abc56ec740727cb499b878fb99689703","observation_id":"08f78ae6-58ba-42ce-b471-ac7950235867","resolution":{"observed_at":"2026-08-06T19:50:20.304795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.492038Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"4ba07b5a-1fc4-4f11-b362-78cd76f01b54","year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.398454Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d340fb6ece89f6daca82ef667876d973db4de97e3a6cce5847b537c776a92a1b","observation_id":"194acbc9-711a-48bb-9adc-f519ce36393a","resolution":{"observed_at":"2026-08-06T19:50:31.539943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.387622Z","title":"Person recognition system based on a combination of body images from visible light and thermal cameras","venue":null,"work_id":"a7f1057c-1596-49b0-93a5-83c638d4bf16","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.525721Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9ea5f1a8f283d0ed2e47d12227d7d1f53a8880e7c2c70eb7c45522ad9886d874","observation_id":"43b4d318-5029-4061-b742-6bc3205a9dad","resolution":{"observed_at":"2026-08-06T19:50:31.423488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10437","last_updated":"2020-02-20T21:08:57Z","snapshot_observed_at":"2026-08-14T16:26:52.986402Z","submitted_at":"2019-05-24T20:28:57Z","title":"N-BEATS: Neural basis expansion analysis for interpretable time series forecasting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10437","snapshot_observed_at":"2026-08-06T19:50:20.661670Z","title":"N-beats: Neural basis expansion analy- sis for interpretable time series forecasting","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.661670Z"},"links":{"cited_paper":"/paper/1905.10437","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e8ca1dba9177304b94f2f1417d76b9e61ff2539911aba83e8720e1a1a60b5ad2","observation_id":"43fa27db-de94-4685-827b-56ae6cb30588","resolution":{"observed_at":"2026-08-06T19:50:20.661670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:20.767129Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.767129Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:533694ff9ce83fef8a91dc4c6ab3331e49f1469e03705d47cf0a171acb260a80","observation_id":"60e8e3d8-5162-4883-a951-b6a1b9b0e488","resolution":{"observed_at":"2026-08-06T19:50:20.767129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.257080Z","title":"Esc: Dataset for environmental sound clas- sification","venue":null,"work_id":"550b5408-b140-4575-a637-e339f76699fc","year":2015},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.883668Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:28a17dd38ac70e47be7e7ccc99194dae97a97043fc1044d64e6ea2a44802426d","observation_id":"ed785505-9347-4868-91d0-3a3ae50cc0af","resolution":{"observed_at":"2026-08-06T19:50:31.311763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.123699Z","title":"Re- thinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"59334ea8-616d-443c-b6d7-39e525085116","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.990939Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:13bf6aa4ff9ce9390b9df92318da7076595dbf89786644c4dbe54dad942e856d","observation_id":"6b0d0f90-f56e-4ab7-8257-a0b3f156ec28","resolution":{"observed_at":"2026-08-06T19:50:31.184763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07804","last_updated":"2020-07-03T09:59:06Z","snapshot_observed_at":"2026-08-14T16:04:55.108446Z","submitted_at":"2019-07-17T22:59:56Z","title":"OmniNet: A unified architecture for multi-modal multi-task learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.07804","snapshot_observed_at":"2026-08-06T19:50:21.121011Z","title":"Omninet: A unified architecture for multi-modal multi-task learning","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.121011Z"},"links":{"cited_paper":"/paper/1907.07804","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2ffab2535b1f1e0b655f83f1dcad7fef08ff105d1593f12c8033ecc0556ce47b","observation_id":"8a5f51c5-9667-473c-9240-5e22df4fd717","resolution":{"observed_at":"2026-08-06T19:50:21.121011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.009598Z","title":"Point- net++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"b7d24905-a001-4d1d-8e08-1df5256c2278","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.235366Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:a1501e38851332a90bd2a685b2379fb7836f92d4491613c8c61089d5e9534c05","observation_id":"960b3122-f46a-4655-8e8c-c6780eec6014","resolution":{"observed_at":"2026-08-06T19:50:31.040826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:21.380262Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.380262Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:02eb4a8b7380bc7a40b50edf069f1a2278190c61cb6a88802f77aa4f96a5a4e8","observation_id":"85a502b9-ace2-44b5-b02a-a1445bda232b","resolution":{"observed_at":"2026-08-06T19:50:21.380262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.904897Z","title":"Reliable tuberculosis de- tection using chest x-ray with deep learning, segmentation and visualization","venue":null,"work_id":"68b6e51a-63e2-4a1b-908b-822d718b9db5","year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.519423Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f62ddf2f8e19591b77a16ecd5b443feeabfb26337fd842a16895003faf1c2fc5","observation_id":"cebe27b6-d809-402e-aa63-1b51e2012ace","resolution":{"observed_at":"2026-08-06T19:50:30.946155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09595","last_updated":"2023-02-22T18:58:10Z","snapshot_observed_at":"2026-08-16T16:00:40.735898Z","submitted_at":"2023-01-23T17:51:39Z","title":"Zorro: the masked multimodal transformer","version":2},"cited_work":{"arxiv_id":"2301.09595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.09595","snapshot_observed_at":"2026-08-06T19:50:25.489215Z","title":"Zorro: the masked multimodal transformer","venue":"cs.CV","work_id":"9bd4d807-f1c0-4108-a9b9-01250a2f893d","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.672452Z"},"links":{"cited_paper":"/paper/2301.09595","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:aa7e71a92aa952e02031b6b951f744c3700737a761f05129a8a048856072c63d","observation_id":"5f88d135-92c1-4203-823c-dee0e0d6a492","resolution":{"observed_at":"2026-08-06T19:50:25.551900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.767705Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"86892b2f-600a-41b0-a29a-03510e6db373","year":2012},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.776607Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:7d0ada6cc8bcad819710759478a7694d16774495dc1dc4d84628de40ed733b0c","observation_id":"3f24eccf-3cc9-461e-a080-e9ab0c57190f","resolution":{"observed_at":"2026-08-06T19:50:30.817984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.646771Z","title":"Mpnet: Masked and permuted pre-training for lan- guage understanding","venue":null,"work_id":"cce18883-4dd0-44bb-aeba-441a91dea6ce","year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.861378Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:7e36faa91f75b07079cb93d2317e19dfebb33d3ddc724ce642b696ce2b23dbc1","observation_id":"21993166-f068-41a5-84ad-b57e3fca20bc","resolution":{"observed_at":"2026-08-06T19:50:30.698263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.524609Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":"05a4c9b8-8eb2-441d-a615-cf6561c72ccc","year":2015},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.997522Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:27ff2cc400e4c6b473f8e57b4f0149683162ef3fdb1bf4a3d114ccb4b661926d","observation_id":"9a540032-3568-429f-af77-4e6fe5f3d6a0","resolution":{"observed_at":"2026-08-06T19:50:30.580490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T19:50:22.073655Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.073655Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2c77a66bddada3ccaf8336997f53a4b5778e0b82165209aeec4e2208c4aef402","observation_id":"f8a1fc2e-e727-48e9-b9d7-b1eae07b61c2","resolution":{"observed_at":"2026-08-06T19:50:22.073655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05709","last_updated":"2023-11-07T14:00:09Z","snapshot_observed_at":"2026-08-17T20:29:12.418506Z","submitted_at":"2023-11-07T14:00:09Z","title":"OmniVec: Learning robust representations with cross modal sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05709","snapshot_observed_at":"2026-08-06T19:50:22.147490Z","title":"Omnivec: Learn- ing robust representations with cross modal sharing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.147490Z"},"links":{"cited_paper":"/paper/2311.05709","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:27d725536147341c6632869774b39ae98067a687cb6a85f93127ae9f1b7c8521","observation_id":"3fed73df-e32b-4259-aa76-b7be8cddd991","resolution":{"observed_at":"2026-08-06T19:50:22.147490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.414961Z","title":"Hierarchical multi-task learning via task affin- ity groupings","venue":null,"work_id":"ca04e506-afdb-4ee2-8a8b-530b25522693","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.210014Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:57ac3e5bfba4be5f0d83e34a23e56e3a06197146eec9884fc0d3c33a65edf148","observation_id":"8049192c-b68b-414c-a96b-c586b6cd28ba","resolution":{"observed_at":"2026-08-06T19:50:30.455919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12296","last_updated":"2022-01-28T18:01:42Z","snapshot_observed_at":"2026-08-16T17:25:10.165181Z","submitted_at":"2022-01-28T18:01:42Z","title":"Benchmarking Robustness of 3D Point Cloud Recognition Against Common Corruptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12296","snapshot_observed_at":"2026-08-06T19:50:22.270903Z","title":"Benchmarking ro- bustness of 3d point cloud recognition against common cor- ruptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.270903Z"},"links":{"cited_paper":"/paper/2201.12296","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:db9ed553654177256144c1821879203d5224915b2d71ffa7c29bf52617376e2b","observation_id":"f3edae28-32b7-4164-8523-4d5b73918175","resolution":{"observed_at":"2026-08-06T19:50:22.270903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:22.333424Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.333424Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:968460bbcb22b9f53435f5e0a9f56e94b04b5e29c7f093f1799fab166e199bfe","observation_id":"edf6e8df-359f-4bad-8d02-a2c8f3fbc02c","resolution":{"observed_at":"2026-08-06T19:50:22.333424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.229608Z","title":"Contrastive boundary learning for point cloud segmentation","venue":null,"work_id":"fcab4911-e0d4-4766-8592-4d7e0041acdb","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.389608Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:77dcb6364d62de5f9209354df894b60e2e979c1f5d36902e1ad55e70ed6bd7e5","observation_id":"c367eb61-daef-4882-96a4-71cc92cb0c7f","resolution":{"observed_at":"2026-08-06T19:50:30.308893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.064292Z","title":"Small sample hyper- spectral image classification based on the random patches network and recursive filtering","venue":null,"work_id":"b3a81333-bf40-4f6e-abc0-2ddee36408b9","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.462428Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ff69df633eb6e49afd78badac5c3138ee0c3fff9cef5cd34d66ae095f7bc7638","observation_id":"3271b91b-af12-4545-bb64-f5f2e23434bb","resolution":{"observed_at":"2026-08-06T19:50:30.150417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.873033Z","title":"Revisiting point cloud classification: A new benchmark dataset and classification model on real-world data","venue":null,"work_id":"8c8e1463-f303-4f51-b7de-c06bc21a2d22","year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.537912Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d1c1c085b9c3da0b3fe4afba10abb9f368c012f68425babed20c2719d202f627","observation_id":"f1b25de1-73cf-4f19-b089-6357805ff965","resolution":{"observed_at":"2026-08-06T19:50:29.959279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.710987Z","title":"The inaturalist species classification and detection dataset","venue":null,"work_id":"c2eb5e31-9bbb-4c01-af37-0139d68b23af","year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.632705Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:a18bcd5a4a1944dbe03bfcbf61c8f1eeb21c7274372148d49f2de582f0425c42","observation_id":"327fdeff-ef5c-489b-9c7f-53dee17d507c","resolution":{"observed_at":"2026-08-06T19:50:29.779706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.576026Z","title":"Attention is all you need","venue":null,"work_id":"ad6dbc20-8360-40bc-8b9c-e0d529b750dc","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.716235Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b5b0832919ffd21bdf0d70d261e66f17c908bc8c666f4dacaba73297de0dbdcb","observation_id":"b6988d14-15b5-46a2-98e9-f821a035c5a3","resolution":{"observed_at":"2026-08-06T19:50:29.627959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.367786Z","title":"Internimage: Exploring large-scale vi- sion foundation models with deformable convolutions","venue":null,"work_id":"0733524c-5e33-4767-beb2-05d05dfb060b","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.775789Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9c7e84b5966ba2eafe7898a10bd27d206bab7359ebf058a5428d3e65a17ca703","observation_id":"11b94fd8-c192-4958-8fbc-4900b5be83e0","resolution":{"observed_at":"2026-08-06T19:50:29.467629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T19:50:22.840001Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.840001Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f874f7886618af4fb50c626311563ae294d14681eca4d7924228c7d84374f502","observation_id":"90af2435-5042-4201-ad4c-2e1abd6c5506","resolution":{"observed_at":"2026-08-06T19:50:22.840001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.170157Z","title":"Masked feature pre- diction for self-supervised visual pre-training","venue":null,"work_id":"8b2879eb-b997-41bc-9b6b-b8a79d487ffa","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.894679Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:16f57b345fc45456f42e0b3e68108f82c7fbeb471b575182b74524b20355c071","observation_id":"f9b85ae5-edfd-4db3-9b20-6bd5903666be","resolution":{"observed_at":"2026-08-06T19:50:29.260075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.022844Z","title":"Syn- cretic modality collaborative learning for visible infrared person re-identification","venue":null,"work_id":"3ae56cda-3d02-47e1-97db-4a86c50ee3c0","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.941403Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e46613684997556c35bf0bc4f0d5a7b27102a9c1ceb4b6ebd54da2b9ff904c3e","observation_id":"349ba8bd-f659-4ebf-8a76-276997f08069","resolution":{"observed_at":"2026-08-06T19:50:29.084751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14064","last_updated":"2021-06-03T05:16:05Z","snapshot_observed_at":"2026-08-16T18:21:22.060709Z","submitted_at":"2021-05-28T19:05:36Z","title":"Controllable Abstractive Dialogue Summarization with Sketch Supervision","version":2},"cited_work":{"arxiv_id":"2105.14064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14064","snapshot_observed_at":"2026-08-06T19:50:25.267028Z","title":"Controllable Abstractive Dialogue Summarization with Sketch Supervision","venue":"cs.CL","work_id":"da08dfc9-35ff-4913-8f38-e232778e6eae","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.994077Z"},"links":{"cited_paper":"/paper/2105.14064","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:450bcc8e448928b81d3b0c6959b8b2457fe7ea783918b9b566076c1ecef363c1","observation_id":"0d42cd48-9c56-4dc2-846e-3514925e8c9a","resolution":{"observed_at":"2026-08-06T19:50:25.321727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.881491Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers","venue":null,"work_id":"f23aab64-32dc-40c5-9b83-fffdd8804382","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.044939Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2b11db04794d15e710ba1fa6d98840fc6e92cdfcc281387e4f4722e30888409d","observation_id":"cecf0c2d-d737-4047-a8ac-88955a12dafb","resolution":{"observed_at":"2026-08-06T19:50:28.942665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.727123Z","title":"Point transformer v2: Grouped vector at- tention and partition-based pooling","venue":null,"work_id":"c2272ca4-39e4-48ed-bddb-f38aec5ccf4d","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.101262Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e3a163867a0a4410abf381a0acb94385547dce4900eab382374c9e237e94244c","observation_id":"825288bf-78c8-4094-8cf0-1eaa9b17c048","resolution":{"observed_at":"2026-08-06T19:50:28.793382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.544354Z","title":"3d shapenets: A deep representation for volumetric shapes","venue":null,"work_id":"c4839d20-283a-45de-a341-eb747f1c190c","year":1912},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.180431Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f28020d0da23baabbd9423e82ae1abafe4f3c8e4aadb31d764980df743614d6b","observation_id":"4c15fc0b-37a7-42c0-a0ca-8f888624e3ab","resolution":{"observed_at":"2026-08-06T19:50:28.654139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-17T02:16:06.429017Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-06T19:50:23.240129Z","title":"Audiovisual slow- fast networks for video recognition","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.240129Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:df85a1dcf7154b9fec740f2d30dbe30126d0f62f4c6b2dbc33e7b74bc4f6325f","observation_id":"d4f48735-2087-4877-8af9-04073b46d0bd","resolution":{"observed_at":"2026-08-06T19:50:23.240129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.408612Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"01d02f46-361c-449d-931e-228ef64b4d31","year":2016},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.286212Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:48aa1f103c8d18dcb9c3058a151c19481989e0d67810550e7bc18c81f3cf29a3","observation_id":"bfb374f0-7601-4427-96df-5ee5faf71b0e","resolution":{"observed_at":"2026-08-06T19:50:28.456028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06488","last_updated":"2023-05-10T02:11:30Z","snapshot_observed_at":"2026-08-17T12:21:42.483294Z","submitted_at":"2022-06-13T21:36:09Z","title":"Multimodal Learning with Transformers: A Survey","version":2},"cited_work":{"arxiv_id":"2206.06488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.06488","snapshot_observed_at":"2026-08-06T19:50:25.087857Z","title":"Multimodal Learning with Transformers: A Survey","venue":"cs.CV","work_id":"a1ffde19-7e46-4110-ba53-2267b43f8aae","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.399732Z"},"links":{"cited_paper":"/paper/2206.06488","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:53f661a9f4023e4866d183291f36e7928b5776105c661d0ffa43449b54e0eec0","observation_id":"e0c2cd51-f150-447c-a73f-a643a7c81994","resolution":{"observed_at":"2026-08-06T19:50:25.148397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.265471Z","title":"Multi-modal masked pre-training for monocular panoramic depth completion","venue":null,"work_id":"79202fe3-7057-4123-9a3a-ca728ff6ab77","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.499703Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ccf9ea4674b5fb3b9aed9fd291d8b4d39969386c71e67553be3d94c5866b46f9","observation_id":"cfa2cd38-10c1-42a4-8f1e-7a24a37a3490","resolution":{"observed_at":"2026-08-06T19:50:28.330526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06906","last_updated":"2023-08-16T01:53:02Z","snapshot_observed_at":"2026-08-16T15:40:32.295998Z","submitted_at":"2023-04-14T02:49:08Z","title":"Swin3D: A Pretrained Transformer Backbone for 3D Indoor Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06906","snapshot_observed_at":"2026-08-06T19:50:23.580652Z","title":"Swin3d: A pretrained transformer backbone for 3d indoor scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.580652Z"},"links":{"cited_paper":"/paper/2304.06906","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:7a48b310661a4b6877341972ca79820cd0e365022888865790536235690e27d3","observation_id":"f955fc72-ae65-4e44-bf53-cb3a6af81b53","resolution":{"observed_at":"2026-08-06T19:50:23.580652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-06T19:50:23.682264Z","title":"generalized autoregressive pretraining for language understanding; 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.682264Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:93e7ba0da51b02be354f83bd07987011419b29821dfe65d987038cee21b14dea","observation_id":"b008ece1-7827-4814-802a-93820de787d8","resolution":{"observed_at":"2026-08-06T19:50:23.682264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04193","last_updated":"2021-01-06T03:17:49Z","snapshot_observed_at":"2026-08-16T04:32:24.331507Z","submitted_at":"2020-01-13T12:49:22Z","title":"Deep Learning for Person Re-identification: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":"2001.04193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.04193","snapshot_observed_at":"2026-08-06T19:50:24.889369Z","title":"Deep Learning for Person Re-identification: A Survey and Outlook","venue":"cs.CV","work_id":"e5255a80-dfba-4e2a-9a7e-cb2deefdc9e0","year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.740334Z"},"links":{"cited_paper":"/paper/2001.04193","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:a47ba6ec991d0d70ef3936e73875764f5b11678a342ca0a41455b6f99f5f7a94","observation_id":"25e42e8f-0a25-4e26-a6fa-ea9b67d18dbd","resolution":{"observed_at":"2026-08-06T19:50:24.969127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.121162Z","title":"Do transformers really perform badly for graph representation? In Thirty-Fifth Conference on Neural Information Process- ing Systems, 2021","venue":null,"work_id":"d8f55edc-25cd-4070-b4cf-be3949249ae7","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.790277Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b0a3aa9fc92c22a70cc4269eaaa61177d7df766c304b3d591077866f28d24dd7","observation_id":"240ad846-4d80-4e93-a896-f29ed0221efb","resolution":{"observed_at":"2026-08-06T19:50:28.189988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T19:50:23.861350Z","title":"Coca: Con- trastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.861350Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8d3c822dd1473ada7faf576aa3ad5500ad4b4ea634719f76a809f5d1768422d9","observation_id":"7aceffcd-fbf6-4549-99b2-da442e37cdde","resolution":{"observed_at":"2026-08-06T19:50:23.861350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.976854Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":"a20a2c35-2a29-42fa-93be-a84ac2597d7a","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.921175Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:15133938e5d24cdb81121d7a5af5852ea6460b7e5183d27f0ae0d874a634154a","observation_id":"e1e514a6-2fda-4a17-8cac-dda7c93bbe04","resolution":{"observed_at":"2026-08-06T19:50:28.047216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.848705Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"796f9dcf-2e4c-46e6-9772-f1c08275af87","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.991722Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:3ca4fed8755a8ce92549bc9c66910c3942b00815fe9de12020478d7d1be27b37","observation_id":"b4baed03-004d-4915-9ad5-4c3216d2b102","resolution":{"observed_at":"2026-08-06T19:50:27.928246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-06T19:50:24.066566Z","title":"So- cratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.066566Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f8bba1eda2daca48822ea2b7baa1f2311c03b2f486984c0df8681b4b9c08d0e6","observation_id":"4ffff764-3d5f-4d5f-8564-951c54b457e6","resolution":{"observed_at":"2026-08-06T19:50:24.066566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.644670Z","title":"Point- cutmix: Regularization strategy for point cloud classifica- tion","venue":null,"work_id":"c1523be8-5592-4f9b-9f6b-04b59e4af985","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.114385Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b24d8083a0093b23de920d480d8c76598a2317c3c900f5b22e36cb568004da8f","observation_id":"b2ebe9a9-9854-4749-93c2-f4b57288dbc8","resolution":{"observed_at":"2026-08-06T19:50:27.750612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.570095Z","title":"An overview of multi-task learning","venue":null,"work_id":"6b282e03-ec4c-4ba1-a914-77d738de7fac","year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.164336Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:bae45b2fff42e2bff6ee3c64e75a6a5938fe3690f9b92ad57b779e5a9b1281cc","observation_id":"521fa700-e1e6-4b00-8163-3c2a9f01e95c","resolution":{"observed_at":"2026-08-06T19:50:27.594862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.468124Z","title":"Modality synergy complement learning with cascaded aggregation for visible-infrared person re- identification","venue":null,"work_id":"cfe87bc0-dbdd-4938-ab83-26e9d4cb991a","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.215744Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:fa2812d58a50d69a6c691097569d0b31276ea891290e64e6d12e6e04bee7b7df","observation_id":"3953969f-63e7-4d49-91f8-48982b077969","resolution":{"observed_at":"2026-08-06T19:50:27.512561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-17T08:08:23.074430Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-06T19:50:24.267156Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.267156Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:c44771bc261cacd667f4e5749591782b48079e773c0643f6c1fb48517d91cf96","observation_id":"af7aa99d-b892-47ac-a506-e0154c640fe8","resolution":{"observed_at":"2026-08-06T19:50:24.267156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.299998Z","title":"Places: A 10 million image database for scene recognition","venue":null,"work_id":"b9862a46-e66a-4934-b7ea-e0c2aa3fc4a4","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.303188Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:43e9056c52f13f6e7112e09bd9e10b51a3fbf7a2ca802a710d1967888f57f577","observation_id":"a316fe08-b859-461a-853f-a88b28f6f36c","resolution":{"observed_at":"2026-08-06T19:50:27.367186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:39:20.131610Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":8,"verified_fuzzy":35},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 0 inbound Pith citation observations for arXiv:2507.13364."}