{"as_of":"2026-08-12T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:827e12d089996e1031fb14c73eb4475f208d38e758ff652f9872446d375a362c","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:04:14.254349Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03916/citation-record","integrity":"/paper/2507.03916/integrity","json":"/paper/2507.03916/citation-record.json","paper":"/paper/2507.03916"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:19.096877Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":"d2558d6a-af37-435d-bbcf-1fd0add03dd3","year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:09.955672Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:6eada858975e758a7cb597c5d0813b91f11c0f3bc93463f5cdb78acae67f381f","observation_id":"c395a067-53ef-4ccb-b30a-dc08fa59f74d","resolution":{"observed_at":"2026-08-06T20:04:19.199956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.820752Z","title":"Infographicvqa,","venue":null,"work_id":"bdd4070c-fdf1-4e15-8ef2-3251a9af48d0","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.072039Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:cc0b8cd1c9de65c086069d35e96895b0d6371199a00c95cf4eb2e6257d32f03b","observation_id":"1b28438b-a3fe-4128-8c23-9f9353e9a0cb","resolution":{"observed_at":"2026-08-06T20:04:18.920954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.593254Z","title":"Slidevqa: A dataset for document visual question answering on multiple images,","venue":null,"work_id":"43417f57-a163-44bc-9018-aa4c4a505ca7","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.189362Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:c5f4f2f10120f31a1633f483cfe6b93a481c2df5b1424949c6315a6b53ab219d","observation_id":"2df9f805-09b6-4fb0-a073-b514c5a137e0","resolution":{"observed_at":"2026-08-06T20:04:18.704656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.380198Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"65218183-6cd4-47f7-b883-49c4da419db2","year":2016},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.342478Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:6d888d6ca058ce348691d35d68df58b62df984d4c85eda540887361d26671398","observation_id":"f4563e43-4b88-4be2-8990-a3fceb74b5aa","resolution":{"observed_at":"2026-08-06T20:04:18.495421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.191108Z","title":"Dense-captioning events in videos,","venue":null,"work_id":"a37ae335-51b3-46c4-bcd9-821e58e257f9","year":2017},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.475082Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:22a52532dcb08fd95c7b7dbd0de29ebaae95e661f514983425a15c80bfe40abd","observation_id":"08d47dbe-8fcf-45b2-995e-772c54db6ee1","resolution":{"observed_at":"2026-08-06T20:04:18.280657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.892377Z","title":"Towards vqa models that can read,","venue":null,"work_id":"32d97b11-fe15-44dc-8849-2e171308a1be","year":2019},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.636457Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:8dc394fa9bcd870e32112d02dbf3a5bf6c5c62a43808b2b046d972ed40b48337","observation_id":"5e442f33-eac8-4dd1-8aa5-3fc047c20570","resolution":{"observed_at":"2026-08-06T20:04:18.037729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:04:10.751674Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.751674Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:dd33319eb500cc133d3c237b6ffadb876ecbce715918d3a0ad8912fabf84621b","observation_id":"8f1a2db1-2a3a-4add-82ed-3acfec3fd233","resolution":{"observed_at":"2026-08-06T20:04:10.751674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.571250Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"ba747f2a-0a47-44b5-9445-c1f1d0c236aa","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.850014Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:19fd84483b9c1ad708aeba386879ac94805379925fd867f71584aa6cd2bbe074","observation_id":"afb972a4-28be-4dd1-8bba-bf8a6557453c","resolution":{"observed_at":"2026-08-06T20:04:17.727409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.318162Z","title":"python-pptx: Create open xml powerpoint documents in python,","venue":null,"work_id":"26e091b3-aafa-4097-95a4-d3b15fa73218","year":2019},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.980238Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:42e1474e9a48bcc38deb3051f411c2f116091aa7c2f568a259efb07fdf0250e3","observation_id":"b5a2dbb4-ea70-4edf-a9e3-95b4227a3f6e","resolution":{"observed_at":"2026-08-06T20:04:17.400977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:11.119793Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.119793Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:f1827d156741dd5fd947dd43e6575472431ca0c0ec3cd57112b905314264d93d","observation_id":"33776ba4-c58e-4dfe-86d9-32512bd56db7","resolution":{"observed_at":"2026-08-06T20:04:11.119793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:11.237427Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.237427Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:ed3bf24ace21ffb4368990ce53b25bfa84b5c883833258007dfffcf22b31f5af","observation_id":"7e77378b-d7c8-4df0-bdf9-81e1c5430b33","resolution":{"observed_at":"2026-08-06T20:04:11.237427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.077281Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"45e97226-54bc-43e1-bfac-4a55568b518f","year":2016},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.361447Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:990e4feb2667652ba713a755085c6177d26196877a6999b4d0e26b34c2ab5388","observation_id":"4fc245fc-f4d6-41aa-bc62-5fa3879789f2","resolution":{"observed_at":"2026-08-06T20:04:17.185503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T20:04:11.505717Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.505717Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:dec44f9296e08d5964e99447d67318a022216037e05da020d0160272afe3ed90","observation_id":"c8eb1cfb-6104-433e-9f23-ed5f6634ba94","resolution":{"observed_at":"2026-08-06T20:04:11.505717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.793821Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"5b66f6ed-6ece-4992-8ee7-439e0f1edd0e","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.654830Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:281fe5c33d1156dba22254702499c77c8e740a457f8eba7f5f5977cf9ee545c6","observation_id":"f3d8a2c0-3142-4172-9299-1b0e655d37b1","resolution":{"observed_at":"2026-08-06T20:04:16.918071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19552","last_updated":"2025-05-21T19:12:41Z","snapshot_observed_at":"2026-08-10T07:02:35.950877Z","submitted_at":"2024-10-25T13:26:32Z","title":"GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19552","snapshot_observed_at":"2026-08-06T20:04:11.787732Z","title":"Geollava: Efficient fine-tuned vision-language models for temporal change detection in remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.787732Z"},"links":{"cited_paper":"/paper/2410.19552","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:21d6aac5e80ae1f29eb9905a2a6438733c76d1a75c6dfaa952a8dc9b5dd666a5","observation_id":"25579411-a4fa-4a53-8687-69c83adccef3","resolution":{"observed_at":"2026-08-06T20:04:11.787732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T20:04:11.888949Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.888949Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:63fdb791f889b4d689f143ee2cb4170d83633e295220e8e22d6949d3797a9020","observation_id":"ea5f9202-a5dc-4ec1-b97a-393df857d521","resolution":{"observed_at":"2026-08-06T20:04:11.888949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:12.035982Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.035982Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:595df134d08e434eca46a379b152cd64626ef04f845dfdd1662977c0d669a64e","observation_id":"b39d791f-4869-43b5-95af-3875843b3abc","resolution":{"observed_at":"2026-08-06T20:04:12.035982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.507441Z","title":"Layoutlm: Pre-training of text and layout for document image understanding,","venue":null,"work_id":"0556ab42-82ab-49fc-bddb-f8594d93fc8c","year":2020},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.156363Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:eddbb1ad1af0d282de52a39cb127e9dc2bc198ebba4cb92b598311b7b08b6c8b","observation_id":"32d36aad-f476-499a-bdc2-7e0f6b44d1e6","resolution":{"observed_at":"2026-08-06T20:04:16.638138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-08-10T07:22:17.598918Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-06T20:04:12.315928Z","title":"Layoutlmv2: Multi-modal pre-training for visually-rich document understanding,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.315928Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:0ee0a83e369ab98f03b6c5346a4fcd027f7c73bd9365bfa73e6f0f28be9d791d","observation_id":"3ceb7149-7d64-49fe-b295-13df1a98afe5","resolution":{"observed_at":"2026-08-06T20:04:12.315928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-06T20:04:12.416233Z","title":"Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.416233Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:3c6a566b9317fa6857537c5468b45a14a79879aa648240bb382bb8bc83c21aa8","observation_id":"3a9ecb96-d720-4380-80fc-6464a625a2d8","resolution":{"observed_at":"2026-08-06T20:04:12.416233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.294795Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking,","venue":null,"work_id":"365d0e29-1d69-401f-8c0e-df6d0c96ccdd","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.517861Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:1f9ab02e955b89a4af1ed6a826b0c8809d3d081ac63e8e5ddc1272cd0b6e7c49","observation_id":"93069f4d-ff76-4b0a-a1f6-fc35d3299d62","resolution":{"observed_at":"2026-08-06T20:04:16.381185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.090182Z","title":"Unifying vision, text, and layout for universal document processing,","venue":null,"work_id":"c5d6914a-09a7-4bd8-976b-6783a27569ba","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.637123Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:2e2dcaded9cb4421d2507cfe19ddcf3911b730f61cec8e216e1da6132db849ec","observation_id":"5d641d5f-7ee8-4f4f-80cb-971c6b5ceb37","resolution":{"observed_at":"2026-08-06T20:04:16.189850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:15.817077Z","title":"Towards automatic learning of procedures from web instructional videos,","venue":null,"work_id":"dcf595c2-36d8-4754-8a35-a13976813eae","year":2018},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.751843Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:627ca53caede8194de059662869a09e0e93288bcfdb6db6781dbd93330a2f1e7","observation_id":"ab129cd5-8c04-4f1b-875a-cd566038aa19","resolution":{"observed_at":"2026-08-06T20:04:15.953547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T20:04:12.865362Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.865362Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:b7c658e73041df52744219493c3590c454aa542b608342b2219ba202d2ecfaf0","observation_id":"ce4ed28f-4ecf-4329-80cf-bd6c990a50dc","resolution":{"observed_at":"2026-08-06T20:04:12.865362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T20:04:13.002034Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.002034Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:6dd75ef3421b403b348ffa2ba2fdbea50736ecdb3cc3654f69c16ab668c2d8c7","observation_id":"28e60d0b-1127-4e64-9a6c-cc9b0317ddf2","resolution":{"observed_at":"2026-08-06T20:04:13.002034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:15.517669Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval,","venue":null,"work_id":"a5830dde-d93b-4ed8-aa1a-ba6b42049134","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.153091Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:adb2a48070a69b864334416c1f54cdb6c1dec47c0f76b4c76d7c2e6ad1bc05e5","observation_id":"9d6141b0-04e1-40ac-91a3-b340e99843a4","resolution":{"observed_at":"2026-08-06T20:04:15.646879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-08-06T20:04:13.314128Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.314128Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:beadf6d6832b8677ef35131188db8769a17e339e4bdf83bd0f1f35ca0a761e6e","observation_id":"8f9c5f80-2681-4dc3-aed7-67647c00322f","resolution":{"observed_at":"2026-08-06T20:04:13.314128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-06T20:04:13.425644Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.425644Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:aea3487bc2be04da3cd741be3ce39a4b758d1ef21478b63daadcde2fd19dd58b","observation_id":"b633c2c2-2d2e-4609-b6f5-f9cef1479bbb","resolution":{"observed_at":"2026-08-06T20:04:13.425644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-06T20:04:13.503234Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.503234Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:69b7991df53a313f479625005ac37927acdeddcc1a725084c98175e23373ae0c","observation_id":"e2191883-4d52-4f65-9ef9-e8cb41d415a1","resolution":{"observed_at":"2026-08-06T20:04:13.503234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:13.548641Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.548641Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:f215c1199979f6755b3f5f1d154641d5a24795526aa927c63a5928ce9f9fce94","observation_id":"a41c1694-56cf-4873-a39a-98715f7f79ea","resolution":{"observed_at":"2026-08-06T20:04:13.548641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-06T20:04:13.653416Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.653416Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:ea1db29775eac084cb055b8c282994741eed991981fb9cebc123f6256f2a688b","observation_id":"241ac941-1d25-4a6f-9925-8e59ec464c91","resolution":{"observed_at":"2026-08-06T20:04:13.653416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-10T14:24:20.137867Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-06T20:04:13.722971Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.722971Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:497f656ab5633e0bb64d809607767f500ad0ab649870e8e39670e3076a239ac4","observation_id":"516f1b29-e1f9-4c7b-89f5-87d015388132","resolution":{"observed_at":"2026-08-06T20:04:13.722971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:15.222565Z","title":"Evaluation metrics for video captioning: A survey,","venue":null,"work_id":"0672d399-66ca-479c-a2c8-700d0540e2f9","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.815372Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:373cd40320779606f6cff488225232095132be15bcb6011af60e444c06383805","observation_id":"ffec0415-ea13-4779-ae3b-7ebd73c1e1f9","resolution":{"observed_at":"2026-08-06T20:04:15.358915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:14.887123Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":"f00ff782-7fa5-4f56-93f2-0eddd19d6ea2","year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.893403Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:5f9d1931ef29c44828d91a94b6813644c7da01e06e92bb6af790681c12942ac1","observation_id":"18ef3acb-5841-415a-b5a1-f8a70a19b3d7","resolution":{"observed_at":"2026-08-06T20:04:15.061021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:14.761579Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"6e2d2814-42c7-4acc-8f48-6bd71a1504f4","year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.974323Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:d0ff3c732f7298a43c4d1b3bffd2f6ca8548e4a02b96cd78103ddbc3806db3fd","observation_id":"2f4cd553-01dc-4ddb-a5b0-af92db97c562","resolution":{"observed_at":"2026-08-06T20:04:14.812717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:14.634543Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding,","venue":null,"work_id":"3e704a4d-f017-466a-8e96-dae3727413d0","year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.050908Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:03c2a2480affec1144b0fb9cf28eca22b9ff4e8055766ba53c76262b1d6a384b","observation_id":"0a774904-43d6-4660-b4f7-18abba67c15c","resolution":{"observed_at":"2026-08-06T20:04:14.672111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-06T20:04:14.128716Z","title":"Tempcompass: Do video llms really understand videos?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.128716Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:1987661040c472402146a549572c7884319cdb2de3a316154e9ddf69fff3d8ce","observation_id":"618594b0-6d38-4c7e-a528-0ed42817d561","resolution":{"observed_at":"2026-08-06T20:04:14.128716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T20:04:14.186124Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.186124Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:a92700ba86445d69661f67a470c2a353e50f05c35f03433527398ced9a60120f","observation_id":"0b657244-8cae-4f8c-bbd8-ae81bfa0b2b9","resolution":{"observed_at":"2026-08-06T20:04:14.186124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T20:04:14.254349Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.254349Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:f35caeec2e156515682deae43349d98b54fa35cb189ccead8605b57145501b26","observation_id":"cbae45d3-4c04-40d1-9178-959b0eee45f9","resolution":{"observed_at":"2026-08-06T20:04:14.254349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T05:08:37.215164Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.03916."}