{"as_of":"2026-08-15T15:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:368e69aa06233c065e4ce1b0bbfa2f5317d6e768c84983cdb273273439743f6b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:18:52.564559Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12593/citation-record","integrity":"/paper/2411.12593/integrity","json":"/paper/2411.12593/citation-record.json","paper":"/paper/2411.12593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.275589Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference","venue":null,"work_id":"f635a607-c496-49c1-8dce-44281446a6af","year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.328144Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:366da78cabc18d7c37166d688894f8b95f759d448419d5e88a2ceb23b16050f2","observation_id":"95410f75-ccf0-4bc0-a682-563d866b901d","resolution":{"observed_at":"2026-08-12T17:18:53.279414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.264058Z","title":"Visual question an- swering, 2015","venue":null,"work_id":"5bbb349e-3f38-43d9-bb5e-172edf6e1171","year":2015},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.333521Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:74fcf7a1503dc09e4ba6b50dddf646564c1df8ebc2c7282d5b7d47fa7b26728f","observation_id":"3d9d42e9-f402-4e97-bc93-0c5f8c977a79","resolution":{"observed_at":"2026-08-12T17:18:53.267667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.337833Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.337833Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:d37c980d72013ef8d01d466b7f3e6d232f4f05250026c6688cf5b517bd81f878","observation_id":"d061cf7e-d4fa-4cf3-b2d0-a8356d2579db","resolution":{"observed_at":"2026-08-12T17:18:52.337833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.343027Z","title":"METEOR: An auto- matic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.343027Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:23adb6f9a3e47fa345c1f7c49e3fc9eaeee93d40ff4fe8cad3dab5bd501abcd6","observation_id":"b99d0214-6897-4263-8098-8ec517658b96","resolution":{"observed_at":"2026-08-12T17:18:52.343027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T17:18:52.347320Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.347320Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:ae35252f085c7b70e887214f27b6ea9f66169c6f6d597bf65e972f98da17ac66","observation_id":"55fec8ff-e7a7-42be-a98c-2e3885118bba","resolution":{"observed_at":"2026-08-12T17:18:52.347320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.236556Z","title":"Chen and William B","venue":null,"work_id":"3eaeb6ca-0b00-4b05-b1ed-b1f2147aecbd","year":2011},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.353574Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:17f3d4208fcc47a2984e1b2890249388e7b62fc84852be65fcaee7b743002ecc","observation_id":"dd5716e1-3e86-4639-b831-6149ab187301","resolution":{"observed_at":"2026-08-12T17:18:53.241155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.221879Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"b6d365e5-f3ed-482e-be26-677f44cd8ce3","year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.357940Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:688523cedc5ec2402895b831230391638be7071644708ae824c913b04d9b18f8","observation_id":"eb0fdabb-c8b5-4f57-abb8-1920dce53d98","resolution":{"observed_at":"2026-08-12T17:18:53.226887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.208177Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"3571fcb6-ab73-41be-a1f5-cf30057c9e18","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.362071Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:9e200b4de904dbde71cc678c0d81aa8f904f57bc2955fb2da6afdfb61336ba3c","observation_id":"6013e716-7fca-49dd-bb7c-1867de592ef4","resolution":{"observed_at":"2026-08-12T17:18:53.213152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-12T17:18:52.366010Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.366010Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:974f295c4efd517ca94720ee6309a29bc8d8d7dd897d655f30ea401dc4f93fd8","observation_id":"66ad7158-bae8-4ee9-bb25-68dc384440cf","resolution":{"observed_at":"2026-08-12T17:18:52.366010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.192689Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":"76a5216f-7418-434c-8247-daf07ec12042","year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.371189Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:875239ffe64bfe8a03bdc17fac88c7175cd8aaec41cacf4402a7b7a464db2172","observation_id":"1f41f1ff-e22a-43d4-9a83-7a60f7d4d602","resolution":{"observed_at":"2026-08-12T17:18:53.198912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.178128Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":"8d2c91cd-ba5b-4d3a-9803-45b240a6abe6","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.374097Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:d52987e30b561a1fbfc9480c88aed589631eb21f2206a75dcf7688be5a9f9758","observation_id":"a505b763-7b73-4d92-8951-1ce2e913d1ba","resolution":{"observed_at":"2026-08-12T17:18:53.182886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.166018Z","title":"Visual question answering: A survey on techniques and common trends in recent literature, 2023","venue":null,"work_id":"97486d7e-627b-4079-ab14-8f0bb0c13090","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.377614Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:54226abfead9ab7593c4d976087713bcd0420079b1ba44b428e13aa071e17fa5","observation_id":"6689eded-43e4-4b39-9861-ebc55cf1cfcf","resolution":{"observed_at":"2026-08-12T17:18:53.170278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.153067Z","title":"Im- pact of green human resource management (ghrm) practices on organizational performance","venue":null,"work_id":"d2929cbe-529f-41bd-ae4b-22224a77392a","year":2020},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.381038Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:7cec440403331674a34a0b99263251f04ffe06ef92f68698996fb9228218e920","observation_id":"09b7155f-029e-4c6e-8626-b2e0e25d88b5","resolution":{"observed_at":"2026-08-12T17:18:53.157152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.142492Z","title":"Model tells you what to dis- card: Adaptive KV cache compression for LLMs","venue":null,"work_id":"474c5033-e4f6-4fc8-87c4-b89bdcde65cf","year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.384972Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:4640954baf17add3379e732169ebbf0cce73906ae4f75c5c1cc2998b86c66884","observation_id":"a153acce-fca9-4ca1-b53d-7701cea2bc61","resolution":{"observed_at":"2026-08-12T17:18:53.145790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.389678Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.389678Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:26270e2f5410b38477cc27ab0494cacf3f339fe829b084a5a452da7f328f0df8","observation_id":"7611fc79-9f75-432a-a42f-31e24613990b","resolution":{"observed_at":"2026-08-12T17:18:52.389678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.122525Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"dd702156-ecd8-4e2b-96c4-7329464e310b","year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.393366Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:23e1b778698dada1d221cb009d9289e2c0f914f705ac424f04c9498661bdcea1","observation_id":"b57164a6-e681-43d6-a38a-5f2995b73726","resolution":{"observed_at":"2026-08-12T17:18:53.127218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.109747Z","title":null,"venue":null,"work_id":"1437253e-6ce4-4972-9d68-1192c04660b8","year":null},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.397069Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:b3fc4713102664fb8e85ea0df2338f20f36983a76bb61bc2f12aa76e7b2925af","observation_id":"6e71ec0a-51d6-48fc-9536-b39f3988c980","resolution":{"observed_at":"2026-08-12T17:18:53.114321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.095730Z","title":null,"venue":null,"work_id":"2b9f2bd0-f9c4-41b2-adca-4dd4cfc111f4","year":2019},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.401642Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:983a273c01f5f6639fabbe5dd981e7569e2573b4f41ec93594e06367814529d1","observation_id":"2f81c3c2-6582-4a9f-aa3b-dab495207558","resolution":{"observed_at":"2026-08-12T17:18:53.100621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01692","last_updated":"2023-01-04T11:54:58Z","snapshot_observed_at":"2026-08-15T13:54:32.871441Z","submitted_at":"2022-04-04T17:58:02Z","title":"Long Movie Clip Classification with State-Space Video Models","version":3},"cited_work":{"arxiv_id":"2204.01692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01692","snapshot_observed_at":"2026-08-12T17:18:52.687936Z","title":"Long Movie Clip Classification with State-Space Video Models","venue":"cs.CV","work_id":"195ea194-ef0f-4596-ae31-a70963f7f7ee","year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.406219Z"},"links":{"cited_paper":"/paper/2204.01692","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:f35d7c1ff16dcfa99392aa9fb5719fe9697702caa9f9727b869db30495809e3d","observation_id":"94794bb2-b37c-42a2-917c-c7035592f231","resolution":{"observed_at":"2026-08-12T17:18:52.696425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03162","last_updated":"2017-04-12T05:53:56Z","snapshot_observed_at":"2026-08-14T21:07:20.316649Z","submitted_at":"2017-04-11T06:22:57Z","title":"Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03162","snapshot_observed_at":"2026-08-12T17:18:52.412135Z","title":"Show, ask, attend, and answer: A strong baseline for visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.412135Z"},"links":{"cited_paper":"/paper/1704.03162","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:39589d72caccb61a9d3da277d3de90dc18395b8d259bbc0687ca53dc9035bbfe","observation_id":"91410906-4c72-4183-9d38-0c265dcd6ed8","resolution":{"observed_at":"2026-08-12T17:18:52.412135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.082090Z","title":"Kuehne, A","venue":null,"work_id":"1fad26eb-4ded-420d-9e9f-d512124898db","year":2014},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.417858Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:bcf19d63fc21d6ef19e8b8835a3a952d6bf3d6486394530dfa9e97bc7466a5b1","observation_id":"3f741578-4054-4cd9-8acf-f7168886f12f","resolution":{"observed_at":"2026-08-12T17:18:53.085920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.422734Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.422734Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:afe13a61cc433c0d52673fd9cbd8104e1f322dce447d0f0bb309c6ebcea620db","observation_id":"fb7e2a55-122b-424a-afe4-bb892213d4bb","resolution":{"observed_at":"2026-08-12T17:18:52.422734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.063952Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":"91d3f926-df83-4f69-a7ed-f59f51ecde8f","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.427704Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:22f749785bbbc08745410d27857806cf6340b9f7ace0c85d527ec05dedeed706","observation_id":"2b12c74e-bce0-4c6e-9be8-3a0251bff48f","resolution":{"observed_at":"2026-08-12T17:18:53.068418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.051462Z","title":"Swinbert: End-to-end transformers with sparse attention for video cap- tioning, 2022","venue":null,"work_id":"fec9bd8b-8103-4237-961c-4c4dba01a9a6","year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.432267Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:08a31fa01ffe86ee87c28a9bad795f29f02a37a47f67be4c817462d54a2f171b","observation_id":"66babe02-ab24-4c5d-b0fb-fce9938a2204","resolution":{"observed_at":"2026-08-12T17:18:53.055301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.036137Z","title":"Learning to recognize procedural activities with distant supervision","venue":null,"work_id":"4853cce4-765d-426d-a0a2-bdd1889e3f9c","year":null},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.437823Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:4212d7fb6b983c86973d8f0fb1f04cd789ec8666b440d9bd45d8033cbbb34f44","observation_id":"6d31e14a-4413-4cfe-8992-22ece5de9a18","resolution":{"observed_at":"2026-08-12T17:18:53.040153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.023399Z","title":"Minicache: Kv cache com- pression in depth dimension for large language models","venue":null,"work_id":"eab9440c-0f35-43c0-8883-826dbc9cb29b","year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.442787Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:23eff3840ceda8803bce05b4bd6a466cc6e67d699f8a8712e19f10f1105aea4f","observation_id":"aea4ce7f-9553-4caa-a556-7dc4e9212327","resolution":{"observed_at":"2026-08-12T17:18:53.027625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:53.008767Z","title":"Vil- bert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"57b68884-4251-4ce4-8406-0b8a8ce05175","year":2019},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.446307Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:a8eb31c56262a320ad6a7cc77334c2933354cf8e2fc4f5dbee796d9b33b92845","observation_id":"65910ce0-ec8e-4968-afa0-be4568b96b69","resolution":{"observed_at":"2026-08-12T17:18:53.013773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.992346Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation, 2020","venue":null,"work_id":"c82ef08d-7032-44c1-9601-a4e6323f69e4","year":2020},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.450111Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:1579af040f7d708d58727b6f4d7835bc7234e139142c3a2d8238f4e65f342768","observation_id":"ecee83cb-8a8d-4eeb-81ca-8fa4ceac7922","resolution":{"observed_at":"2026-08-12T17:18:52.997496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.976799Z","title":"Howto100m: Learning a text-video embedding by watching hundred mil- lion narrated video clips","venue":null,"work_id":"cbf14733-67a3-4368-8ec5-37969860e296","year":2019},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.453664Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:bb5a59c9c0396c02e1302c1d1a57d6fc27cf5871fb1346f8b34a2de22b23b15d","observation_id":"075d7e8d-422a-45b4-a6c6-f24acd4974da","resolution":{"observed_at":"2026-08-12T17:18:52.981415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T17:18:52.460526Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.460526Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:54bdecd0236a301dbd2aacf9d835553027cfe81426c08e5b3af0fc71726892b3","observation_id":"7492252c-79da-4045-be69-edd961913d41","resolution":{"observed_at":"2026-08-12T17:18:52.460526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-12T17:18:52.464083Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.464083Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:67665e9036f465ff7c113ca3da2146c354ec0ef8c3367b4e97e4f2b2c2ec97ef","observation_id":"a8217b22-e0ba-4cb3-ae3d-0647861bbe59","resolution":{"observed_at":"2026-08-12T17:18:52.464083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.469522Z","title":"Keeping your eye on the ball: Tra- jectory attention in video transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.469522Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:5e25fbb292fa254d1f514cc14304f48fa5c1c033c09ab54c966d39c14e9d1f4d","observation_id":"72fea359-d661-4c8d-ab36-520cfa98c52d","resolution":{"observed_at":"2026-08-12T17:18:52.469522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-15T01:20:03.559618Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-12T17:18:52.473471Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.473471Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:40098fe420fcdecdadd86777d0e04d0a7d10bb5b8957be3e7024962a1623d1e1","observation_id":"56c991cf-ec6c-4fcb-8895-cd15d0bd106f","resolution":{"observed_at":"2026-08-12T17:18:52.473471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.960235Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"f2ad30b1-354b-4ea4-885a-423a3e40a6a3","year":2019},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.478290Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:5f01692fefaa14a7c8ad2bdd8c044162e32b25d6817bdc1cd3ea993c3ead1127","observation_id":"4133aced-a1b2-492c-b9e7-5279d56d9b51","resolution":{"observed_at":"2026-08-12T17:18:52.963845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.483532Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.483532Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:9239be1bf22d7e14531be1414e45f1386b41fe8170bccc25f1f3633e179570f3","observation_id":"7b98fb64-484c-49ba-9865-0d3af1ea7b2b","resolution":{"observed_at":"2026-08-12T17:18:52.483532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-08-14T16:52:36.554748Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-12T17:18:52.489724Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.489724Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:6a700d14632fa77cea38ac0969dbc1bf93948ca241e6c2fa4ec0a4137fbb475f","observation_id":"a3b4c4f3-f47a-4e99-aecd-871d1b2de118","resolution":{"observed_at":"2026-08-12T17:18:52.489724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.942013Z","title":"Plummer, Bryan Russell, and Kate Saenko","venue":null,"work_id":"76ca1660-3389-4b72-a32e-9971364cdb8a","year":2024},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.494322Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:99a8b598fc17dea1d291e2e1b0670e1066497ecd4683d5d2b796c582aee200c9","observation_id":"c3e5e8fc-7a81-4004-ba67-7218589bec66","resolution":{"observed_at":"2026-08-12T17:18:52.946562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.928194Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"103a094f-d4d1-4f16-9e2b-786b1e91f6ce","year":2019},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.498051Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:df6c4a94d1369d2a4e1b9d4b76e90f391f8a06398c8de6a82b0b966beed701ac","observation_id":"0b872129-f3a2-498d-8e96-d1a7efca6d50","resolution":{"observed_at":"2026-08-12T17:18:52.932846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.916516Z","title":"Llama: Open and efficient foundation lan- guage models, 2023","venue":null,"work_id":"d6f5f9c8-8354-44af-9bd4-50fed5bff14a","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.502098Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:24473d27ae66e8d13a54b06159c81fe050f53b0e0ca5faffa0f4ba3555725f84","observation_id":"2a97bc42-4581-462b-bfed-7a8a149d692e","resolution":{"observed_at":"2026-08-12T17:18:52.919833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-14T23:10:48.763001Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-12T17:18:52.506611Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.506611Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:ddcf9e3191771dc1f136e10785b99acdda61773ea72b096a7780d66f053c86ec","observation_id":"894dcfd0-3ec2-4ef6-9207-e8d736315a54","resolution":{"observed_at":"2026-08-12T17:18:52.506611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.905411Z","title":"Git: A generative image-to-text transformer for vision and language, 2022","venue":null,"work_id":"2a433096-0ce2-49ab-b0b0-b792519191c9","year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.512572Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:0490d69fc141defc7cd0c6abf6a43fb7ea01bd984eb337d7a8dfde6a65b11214","observation_id":"de244629-3e21-438e-baa8-6cba81bd515a","resolution":{"observed_at":"2026-08-12T17:18:52.909115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.893503Z","title":"Selective structured state-spaces for long-form video understanding","venue":null,"work_id":"89a37d88-c8a3-4361-8457-b6ca36b46c5f","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.516806Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:cd71f17900c7492e26fbe15a5c03a59d6813654ecb3ad928d285febc757c996e","observation_id":"7714a6ad-3b9d-4ccc-8727-cf6881322b8d","resolution":{"observed_at":"2026-08-12T17:18:52.897742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.520356Z","title":"Selective structured state-spaces for long-form video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.520356Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:84620bc071db5c35243a117a9c3aba1d92bfb652aee0cafe255f91cd12b40053","observation_id":"7f0e9205-dc34-4621-ab15-816f2b720674","resolution":{"observed_at":"2026-08-12T17:18:52.520356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.871132Z","title":"Temporal segment networks for action recognition in videos, 2017","venue":null,"work_id":"5595c76b-c465-4ad0-ac9f-adde9f55db75","year":2017},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.525464Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:9f33bb4df93d2b99a3f9dcdea8a5f3c088ec3a7614eb2fe3184c5b38552530d5","observation_id":"1d4e1cc1-1f14-423f-b893-7fca84a06a2a","resolution":{"observed_at":"2026-08-12T17:18:52.876048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.859429Z","title":"Towards Long- Form Video Understanding","venue":null,"work_id":"59f0dd27-01d2-42b6-9306-eae0c70f0859","year":2021},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.529834Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:e9b957674977eeab8be2f7b2dd4fef511690b4139914de39a83d43a762df5939","observation_id":"7ac3aaf5-c131-4121-81f9-b70d974197cd","resolution":{"observed_at":"2026-08-12T17:18:52.863050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.849252Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"b915e09a-b3ce-4058-9b42-a60d8d148fec","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.533263Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:c8c29f606a0932b441e261e0f55c294645e9e415d600607d13ac2f240c595eea","observation_id":"03a8e9b9-470b-4925-95b9-42734523eb9f","resolution":{"observed_at":"2026-08-12T17:18:52.852767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.836567Z","title":"mplug-2: A modularized multi-modal foundation model across text, image and video, 2023","venue":null,"work_id":"bcc34cb7-5c55-45b5-a9c3-6aae8babc710","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.537052Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:3f8aea97f7678b867092f1c2b1053540241df98b646af246f4b8b1ea17103530","observation_id":"5db191bf-582b-42a4-aae7-78b4d46c826c","resolution":{"observed_at":"2026-08-12T17:18:52.841104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.824582Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"692570bf-e364-4ed9-a2a5-9b66427db763","year":2016},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.540635Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:891aeb57de22894a5579985c91e2a025db5a123b1d1c784fc8ef118b49ef3732","observation_id":"c07de36d-fa67-4162-94ed-11b3435b0afe","resolution":{"observed_at":"2026-08-12T17:18:52.829041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.812158Z","title":"Videococa: Video- text modeling with zero-shot transfer from contrastive cap- tioners, 2023","venue":null,"work_id":"6d18b094-d2db-48f0-9749-e9a1de1fa0b1","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.544018Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:dc0c1d38820b84dfec37ec9275e6619894aba8090e8694bc3671136e1b79c940","observation_id":"7e9436db-1f67-4dac-b7ed-f23d50b24f5d","resolution":{"observed_at":"2026-08-12T17:18:52.816592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.800855Z","title":"Stacked attention networks for image question answering","venue":null,"work_id":"b8f755c0-f8b0-4638-bc1a-6a3e57b45294","year":2016},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.547004Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:b28285cee737fa72fc5ce17f982459131505f0e820addbe5dd9a2e0e6e624fc6","observation_id":"407d2704-b126-4b9a-b957-b6880cc39b26","resolution":{"observed_at":"2026-08-12T17:18:52.804610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.789620Z","title":"Scaling vision transformers, 2022","venue":null,"work_id":"c58a8628-17d1-4968-b9d5-43c000e6a3bd","year":2022},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.549987Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:826b281c0b1869b14421da553c4a42aa8c1422a2328bf512722396579a10d5f7","observation_id":"2857f9ec-ec6f-45bd-953d-08344b617ec9","resolution":{"observed_at":"2026-08-12T17:18:52.793904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.775139Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding, 2023","venue":null,"work_id":"db0aa459-69e8-4005-a03f-3b714a4a9987","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.553106Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:e90a0a5ae64f2532076556571a4ad94a0ba6d66bb8928ec877de6d1854344c07","observation_id":"0333f01d-dfe9-4fb5-89eb-902d1b851174","resolution":{"observed_at":"2026-08-12T17:18:52.780995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T17:18:52.556066Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.556066Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:9bb4be5bfaf1029bbe8b3d183eb1917b1c99c5377f41af5fe86089ba807f04fb","observation_id":"a3e1a175-0111-4a5d-83e1-c1902a5a5706","resolution":{"observed_at":"2026-08-12T17:18:52.556066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.761078Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"588e788e-860d-4158-ba5b-656904191eb7","year":2023},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.559752Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:0f9339a4eadd6a7bdc4d6fff73488cfe0ab83770a5d37d1efd387ad34e576800","observation_id":"a73a199a-10d1-476b-ac92-6badf7163f57","resolution":{"observed_at":"2026-08-12T17:18:52.767157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:18:52.748040Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"3de40f4a-c2da-49da-9591-a7786e3920c7","year":2018},"citing_paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:18:52.564559Z"},"links":{"citing_paper":"/paper/2411.12593"},"observation_digest":"sha256:3b50a5515551c1c0b87ff17c3bbc35a0663433f9c2c4db4f920bd7e4415f9674","observation_id":"fd4519f6-10fb-4168-bcd2-244b465266f9","resolution":{"observed_at":"2026-08-12T17:18:52.752733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12593","last_updated":"2025-04-04T17:58:08Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:49:32.643098Z","submitted_at":"2024-11-19T18:04:13Z","title":"AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2411.12593."}