{"as_of":"2026-08-11T13:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:199c810a5ebd02c0ee39cf16ed6c9ed2ae861721dd7678c1e7b8bf5360817ec7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:57:41.937067Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03332/citation-record","integrity":"/paper/2501.03332/integrity","json":"/paper/2501.03332/citation-record.json","paper":"/paper/2501.03332"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.740849Z","title":"Multimodal personality recognition using cross-attention transformer and behaviour encoding","venue":null,"work_id":"90168ea9-6c38-4490-944b-b64709adeb42","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.747478Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:9fe09611fc392fd0533bf548923e663fca14edb7d2439fdd4a7d75451b61d391","observation_id":"cefb8f7e-1b1c-4885-895d-066ea60b3fd7","resolution":{"observed_at":"2026-08-10T21:57:42.746006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.726119Z","title":"Multimodal vision transformers with forced attention for behavior analysis","venue":null,"work_id":"4bb0011e-51ee-4ee8-bfc7-af27e1be2691","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.752893Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:5e52941ea8bf5876e89179e2f9f2326c10d6d25187d1e8ad027e27f211eb5f99","observation_id":"9a3d884a-bb0a-4e77-989b-edcb82da6259","resolution":{"observed_at":"2026-08-10T21:57:42.730891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11178","last_updated":"2021-12-07T04:01:25Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:07:41Z","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11178","snapshot_observed_at":"2026-08-10T21:57:41.757556Z","title":"V ATT: transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.757556Z"},"links":{"cited_paper":"/paper/2104.11178","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:22dddd803150ad686e51a7108f569517ff54bcb46f75eda9a7ded40635521f22","observation_id":"1eaf3175-b942-4fb1-8eb4-6ab022416907","resolution":{"observed_at":"2026-08-10T21:57:41.757556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.710733Z","title":"Vivit: A video vi- sion transformer","venue":null,"work_id":"1742ec51-7750-424e-847e-cb9f8c15cd9a","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.762729Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:ec80e98c6cb36993a61e783183bb5931b93126af548981bc6466cd3f7ff78c7e","observation_id":"1c420e10-9362-479c-a3a8-236326b87c4a","resolution":{"observed_at":"2026-08-10T21:57:42.716215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.695478Z","title":"Bodily be- haviors in social interaction: Novel annotations and state-of- the-art evaluation","venue":null,"work_id":"e1dff8f6-79dd-4f3f-ab5a-b875e3815bfc","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.767362Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:30d5b3992fb3771971e7403aa87e995e6d130e9b998673cee7d9d87a0ceb7b20","observation_id":"3e79fad3-0e5a-4983-a89b-43454524ad2d","resolution":{"observed_at":"2026-08-10T21:57:42.700369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13535","last_updated":"2022-10-15T01:31:42Z","snapshot_observed_at":"2026-08-07T21:46:09.780655Z","submitted_at":"2022-05-26T17:56:15Z","title":"AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13535","snapshot_observed_at":"2026-08-10T21:57:41.772310Z","title":"Adaptformer: Adapt- ing vision transformers for scalable visual recognition.arXiv preprint arXiv:2205.13535, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.772310Z"},"links":{"cited_paper":"/paper/2205.13535","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e29d353e2b8eafc237878191ff1a623d75ec02f36a0e4892cb65b4c39c993aed","observation_id":"be8de12e-1c86-499f-b53b-51028f9afdec","resolution":{"observed_at":"2026-08-10T21:57:41.772310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13256","last_updated":"2021-09-17T17:17:48Z","snapshot_observed_at":"2026-07-06T09:32:02.150002Z","submitted_at":"2020-06-23T18:28:04Z","title":"Rescaling Egocentric Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13256","snapshot_observed_at":"2026-08-10T21:57:41.777674Z","title":"Rescaling egocentric vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.777674Z"},"links":{"cited_paper":"/paper/2006.13256","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:0aab7a37e2211a2a603bd426032bddacaef61a883edab54962b242672cff32b3","observation_id":"29b47da0-5ead-46ef-98c8-e46eb20e0c02","resolution":{"observed_at":"2026-08-10T21:57:41.777674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.680274Z","title":"A transformer-based joint-encoding for emotion recognition and sentiment analysis","venue":null,"work_id":"5bf848a5-5e71-4c38-83aa-ed231b182894","year":2020},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.782611Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:a0aaf2e2cc7135963542d68a6129ae20d97a9ea6aa2ce595a8f7311c09df6b33","observation_id":"2d7d4960-2027-4a56-9d79-a5fc39f7bf2c","resolution":{"observed_at":"2026-08-10T21:57:42.685448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04332","last_updated":"2022-03-14T02:05:06Z","snapshot_observed_at":"2026-08-09T18:32:47.872424Z","submitted_at":"2021-09-09T15:11:04Z","title":"PPT: Pre-trained Prompt Tuning for Few-shot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04332","snapshot_observed_at":"2026-08-10T21:57:41.786939Z","title":"Ppt: Pre-trained prompt tuning for few-shot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.786939Z"},"links":{"cited_paper":"/paper/2109.04332","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:61622553685f05c1303fa1901376ffd30604d3ddbc7bc2fd3b6a66d71f81c051","observation_id":"517d6aa6-979a-4842-a0e5-e3e409206b80","resolution":{"observed_at":"2026-08-10T21:57:41.786939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-09T04:45:04.547249Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-10T21:57:41.791474Z","title":"Towards a unified view of parameter-efficient transfer learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.791474Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:46e7f3189b82032b58c018abba911859d038e00ae0a8ed085811e8a28efc43e2","observation_id":"57d12086-2d8c-486e-96e5-af7792988656","resolution":{"observed_at":"2026-08-10T21:57:41.791474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.663132Z","title":"Parameter-efficient trans- fer learning for NLP","venue":null,"work_id":"90447202-d88e-49d0-a3aa-6f55169806e8","year":2019},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.796366Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:276dbb6b9ca3c8632618389a61fc935ee3f9d41a21e43d92c8008e20e53ad6d0","observation_id":"17187cc0-9144-4617-b319-154d44b933fc","resolution":{"observed_at":"2026-08-10T21:57:42.669455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.647176Z","title":"Lora: Low-rank adaptation of large language models, 2021","venue":null,"work_id":"438cfeef-0716-439c-85ff-b4667460c5fe","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.801052Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:b11527157c6971b3d01849501f999676ebc5e88ff1ddd57cf2a68135220409c8","observation_id":"d50bb71c-9b26-4cca-9ca9-3d8dff2a5375","resolution":{"observed_at":"2026-08-10T21:57:42.652332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T21:57:41.805566Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.805566Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e3bb00f224028bc00447497516cf206fd83ddf910f5f495a2ce8bdc9cdeb86f8","observation_id":"5f3ad6b7-82a6-4838-98de-3a7c28a17858","resolution":{"observed_at":"2026-08-10T21:57:41.805566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.632330Z","title":"Mumu: Cooperative mul- titask learning-based guided multimodal fusion","venue":null,"work_id":"3a70c35c-23c0-45b3-ba0c-c45b07597f3d","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.810254Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:cb311e78ed2116c04929af179448014c40a730c9cb471fe53996689d6508a9b7","observation_id":"47638112-c3bb-4db1-b42e-0a4f6c7fee1f","resolution":{"observed_at":"2026-08-10T21:57:42.637267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.617449Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"2c0d98d8-3330-4bd2-a775-7cb308978fa7","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.814539Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:241c93ea741fd53672c33ad457191105714a37f036015d6cd92a2a0f489b2fcf","observation_id":"1e937211-8683-4eed-a255-fd36306eb630","resolution":{"observed_at":"2026-08-10T21:57:42.622072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.601905Z","title":"Compacter: Efficient low-rank hypercomplex adapter layers","venue":null,"work_id":"ccf03f73-e535-44c6-88c6-15783be812bb","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.819154Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:204be315bcf9c2af03a9dd43266a19ff5f4b4d4a8d472baecd119242fdee6ef9","observation_id":"062b865c-3421-4328-b567-87405a285e13","resolution":{"observed_at":"2026-08-10T21:57:42.607216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.586400Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks","venue":null,"work_id":"8ffabc3e-f79d-4588-9987-4c843ae3d0a7","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.823645Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e1d6ee65436d7b8f048a42a44255e59df175b74a75025670ea7c5c61b0783e16","observation_id":"37329977-4498-4e23-aac8-b181ca94c9e5","resolution":{"observed_at":"2026-08-10T21:57:42.591462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:41.828211Z","title":"Transformers in vision: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.828211Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:0ed651f2545867c3cde434ad943f907482af4948347dd695a2907ff56cffff7c","observation_id":"039df51b-eee5-410e-b860-2f411990162c","resolution":{"observed_at":"2026-08-10T21:57:41.828211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.01043","last_updated":"2020-02-21T06:58:03Z","snapshot_observed_at":"2026-08-02T19:12:36.777089Z","submitted_at":"2020-02-21T06:58:03Z","title":"Gated Mechanism for Attention Based Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":"2003.01043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.01043","snapshot_observed_at":"2026-08-10T21:57:42.248923Z","title":"Gated Mechanism for Attention Based Multimodal Sentiment Analysis","venue":"cs.CL","work_id":"c88cf28a-d8a4-42aa-95a7-c6dccdf88051","year":2020},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.832911Z"},"links":{"cited_paper":"/paper/2003.01043","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:df1d8fc4ab040d10823bfd2ddadd2f2049dbd060a41385684f88bc7d16819dee","observation_id":"ecc15948-d0c0-46eb-b0a4-d2f7e61e1c0c","resolution":{"observed_at":"2026-08-10T21:57:42.254175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.561871Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"4fe7c1fe-9c12-4511-b577-fa962b0433f8","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.837764Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:5dc595de53978db03a8edd4c88fcbf68d238782493ad791e0dd829320d59b985","observation_id":"f7680172-9a00-48f8-b83c-08944022ab9a","resolution":{"observed_at":"2026-08-10T21:57:42.566531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-10T21:57:41.842107Z","title":"Prefix-tuning: Optimiz- ing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.842107Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:ce74f8c2b21f0d4c354b586ac6dcde4c4a4767517e4f073e679d148aa34b99e3","observation_id":"a2452fab-058f-49ef-a192-af15732c1147","resolution":{"observed_at":"2026-08-10T21:57:41.842107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.546716Z","title":"Video swin transformer","venue":null,"work_id":"5fed47dc-cc8b-4910-b902-8cbb135b0d4a","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.847102Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e6dd70c289203aa48ab0fad7860dd81f3a869ef7f61d848db88c6fa88556c798","observation_id":"0ec927f3-ed76-41bd-aca2-7d3101e3d2f0","resolution":{"observed_at":"2026-08-10T21:57:42.551485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04489","last_updated":"2021-06-08T16:16:40Z","snapshot_observed_at":"2026-08-03T19:17:21.128233Z","submitted_at":"2021-06-08T16:16:40Z","title":"Parameter-efficient Multi-task Fine-tuning for Transformers via Shared Hypernetworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04489","snapshot_observed_at":"2026-08-10T21:57:41.851696Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks.arXiv preprint arXiv:2106.04489, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.851696Z"},"links":{"cited_paper":"/paper/2106.04489","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:152d5b94ce061a0d6470db62a9787503a09623bbd3b67d1b8a74ba68b8122de2","observation_id":"c4eee4e8-5c4c-4682-9226-73692234e2f5","resolution":{"observed_at":"2026-08-10T21:57:41.851696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07577","last_updated":"2022-09-04T23:31:05Z","snapshot_observed_at":"2026-08-01T19:07:06.818808Z","submitted_at":"2021-10-14T17:40:08Z","title":"UniPELT: A Unified Framework for Parameter-Efficient Language Model Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07577","snapshot_observed_at":"2026-08-10T21:57:41.856385Z","title":"Unipelt: A unified framework for parameter-efficient lan- guage model tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.856385Z"},"links":{"cited_paper":"/paper/2110.07577","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:f937662c08e35e1712709ee3698d7024c49db1a4083984355fc49742940b42e9","observation_id":"f125b378-f6e3-48ad-9f6f-80238fe6635f","resolution":{"observed_at":"2026-08-10T21:57:41.856385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.531902Z","title":"Tiny adapters for vision transformers, 2023","venue":null,"work_id":"f8c8b1ef-1dfa-4d89-b19a-d95e63f85c86","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.861544Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:0fc42314af1b121c889a8f63b11e4f9206ddc56484fc37523ddf8ccb6078cda2","observation_id":"791ab3e0-3809-4a6c-a617-1c3875df456e","resolution":{"observed_at":"2026-08-10T21:57:42.536574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.516211Z","title":"Context- aware personality inference in dyadic scenarios: Introducing the udiva dataset","venue":null,"work_id":"33b2ac6d-626a-4d66-ae48-5b0d102acfb9","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.865979Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:a33a4cd3849fb6daff95d0c83e224fe1efe3e3d8242c38ca57fbe68b6d606a21","observation_id":"3ab3513c-5b1e-444a-84ab-a79ca64d5114","resolution":{"observed_at":"2026-08-10T21:57:42.521422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13559","last_updated":"2022-10-13T06:34:19Z","snapshot_observed_at":"2026-08-02T02:14:22.911676Z","submitted_at":"2022-06-27T18:02:29Z","title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.13559","snapshot_observed_at":"2026-08-10T21:57:41.870525Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning for action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.870525Z"},"links":{"cited_paper":"/paper/2206.13559","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:2e8ddf1caa9fcd633875841b2721da3328b5ef3d4b2ed52445a91e7c5f739743","observation_id":"f5f113a2-2ebc-4f1c-9de3-62d70bf10728","resolution":{"observed_at":"2026-08-10T21:57:41.870525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.500445Z","title":"Dual-path adaptation from image to video transformers","venue":null,"work_id":"e498c21b-d2f1-42f8-a712-c6c829acfc8c","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.875584Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:0f46f6f92a8fd3093aeaad256ee0b77cb500f2127ccca1f8996121c81170fd10","observation_id":"70d7c14b-1d06-43ed-a5ee-6204b3fdae4c","resolution":{"observed_at":"2026-08-10T21:57:42.505307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.485630Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"bf3212fd-eb72-44c9-94d3-dc641313dbea","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.880284Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:b8845b3de9b151cc8f8d904da12d80520aa0784ee7dbbeb3d009675c0a48d3fd","observation_id":"c53a2f50-64df-4e3c-9c6f-09538f2edcfb","resolution":{"observed_at":"2026-08-10T21:57:42.490340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.469605Z","title":"Learning multiple visual domains with residual adapters.Ad- vances in neural information processing systems , 30, 2017","venue":null,"work_id":"a2128649-e102-40cc-9401-02b1e8a344e8","year":2017},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.884972Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:c5daf7988f19114a0f33b395a15e91060c4987342fbbfd328118e6279615f000","observation_id":"7dcef711-74ce-4ef1-a1d0-c7859b704e57","resolution":{"observed_at":"2026-08-10T21:57:42.475392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.453418Z","title":"Efficient parametrization of multi-domain deep neural net- works","venue":null,"work_id":"5155782c-5722-435c-85dd-7499d904b3c3","year":2018},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.889613Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:17223e598e33302f6988430b64fbe6e7cf30a7028f4f0535651df80833fc32e5","observation_id":"b3cddac2-21f3-4624-99d5-391385aecde6","resolution":{"observed_at":"2026-08-10T21:57:42.459033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05494","last_updated":"2023-01-13T11:50:08Z","snapshot_observed_at":"2026-08-03T05:34:26.570506Z","submitted_at":"2023-01-13T11:50:08Z","title":"Multilingual Detection of Check-Worthy Claims using World Languages and Adapter Fusion","version":1},"cited_work":{"arxiv_id":"2301.05494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.05494","snapshot_observed_at":"2026-08-10T21:57:42.160487Z","title":"Multilingual Detection of Check-Worthy Claims using World Languages and Adapter Fusion","venue":"cs.CL","work_id":"58759064-1184-4d3b-a7d0-a3da466fc4e9","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.894087Z"},"links":{"cited_paper":"/paper/2301.05494","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:b6475814a79591dd46a8380521fd95d13966e76dfa6856bd0f884e25d27f3083","observation_id":"05eb2b85-d972-4d7e-bba8-745c2bd5e3f7","resolution":{"observed_at":"2026-08-10T21:57:42.167868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.437350Z","title":null,"venue":null,"work_id":"44cacb30-f6b9-4edf-a3f8-dd5ebdff4063","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.899007Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e55124f81a2dcdf9d7088f6c20771b710131aafb53968d5a56a262becb8757e7","observation_id":"332d9f91-1186-490b-a9da-593c90a511ec","resolution":{"observed_at":"2026-08-10T21:57:42.442110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.420420Z","title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks","venue":null,"work_id":"2bf2f0ba-4198-442e-bc4d-d0e145cec935","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.903694Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:df7fa318ec2adb28c03a71752373d0da0572d445bc4e886234f585347668f72a","observation_id":"811a7111-1a81-440f-b2b4-57d8cfb7adc8","resolution":{"observed_at":"2026-08-10T21:57:42.425548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.403546Z","title":"Training neu- ral networks with fixed sparse masks","venue":null,"work_id":"02b93639-6d37-434f-afa6-c752fb187551","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.909217Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:6921efb73cd45b39a46f78957dc7505e6ba5200e4559081ee3d6d5161deebad3","observation_id":"df61c7e2-bb0c-4dfa-929a-4697adc19e80","resolution":{"observed_at":"2026-08-10T21:57:42.408691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.387600Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"61b127b2-b2b5-4024-aa45-82f4da7bf368","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.913810Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:bd2d0fc268d610dd699588bbc2a59efadbc56900c0732de6e7bec36527cbf4fb","observation_id":"1051fd7a-9059-410d-b500-fc5f29f641da","resolution":{"observed_at":"2026-08-10T21:57:42.393480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-10T21:57:41.918538Z","title":"Videomae: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.918538Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:874dcd97cffee0627b2ad4daf52c1e02185fa81509dfc75d01feebdff6589d18","observation_id":"3e61394d-7238-44fd-9e1c-9f45e904f98e","resolution":{"observed_at":"2026-08-10T21:57:41.918538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09852","last_updated":"2022-06-20T15:31:13Z","snapshot_observed_at":"2026-08-07T22:31:22.587774Z","submitted_at":"2022-06-20T15:31:13Z","title":"M&M Mix: A Multimodal Multiview Transformer Ensemble","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09852","snapshot_observed_at":"2026-08-10T21:57:41.923255Z","title":"M&m mix: A multimodal multiview transformer ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.923255Z"},"links":{"cited_paper":"/paper/2206.09852","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:aa03bac7b4a34ecfdcba9b69b42f88cc55495cbd774a75091c1d757c4eca9532","observation_id":"a9217669-4064-436c-9976-7f7f8fe6acda","resolution":{"observed_at":"2026-08-10T21:57:41.923255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.371802Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"9cd90132-a9f3-4a0d-bb63-70b12f9af703","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.928345Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:8e112726e7cbc8aeb1c54ae8749d9f88f06e1ae744e647e00c1b2242d7f878db","observation_id":"31ca9c65-cca4-4d16-a0fd-a23491cd5239","resolution":{"observed_at":"2026-08-10T21:57:42.376564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:41.932616Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.932616Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:bc86d81ec21176e68d713e180ca82257d543d401d7d082cc74e7184b212fd274","observation_id":"80143f1f-e6e2-45f7-9206-914917274a3d","resolution":{"observed_at":"2026-08-10T21:57:41.932616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.355991Z","title":null,"venue":null,"work_id":"718b772c-9544-42f4-8f0f-0ca95f4c6eb7","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.937067Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:8b274425c320904aff5862b8dd7880295db63d4dfa417a56071e5a6f8e437e8c","observation_id":"fab0796f-1759-49e8-a8e4-9bd83f972ab1","resolution":{"observed_at":"2026-08-10T21:57:42.361307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:50:36.131711Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2501.03332."}