{"as_of":"2026-08-09T19:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf8f604fe544dcd245342ab19407874d36a217a799fabfaf5d01d44b53675909","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:21:08.559862Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:27:03.674229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:33:15.607500Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15435","snapshot_observed_at":"2026-06-29T08:33:15.607500Z","title":"Timecausality: Evaluating the causal ability in time dimension for vision language models","venue":null,"work_id":"a5bbc6a7-8486-45d2-98e6-f5c8ec24d426","year":2025},"citing_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-08-08T17:35:04.569091Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T17:57:57.263574Z"},"links":{"cited_paper":"/paper/2505.15435","citing_paper":"/paper/2512.01843"},"observation_digest":"sha256:412fd348ed1950bb734bf820e0caecc780482a8fb179cea6578d7fece9e5ee93","observation_id":"8a733963-de16-4af8-853e-52b0ee40ef37","resolution":{"observed_at":"2026-05-21T18:00:27.293745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15435","snapshot_observed_at":"2026-06-29T08:33:15.607500Z","title":"Timecausality: Evaluating the causal ability in time dimension for vision language models","venue":null,"work_id":"a5bbc6a7-8486-45d2-98e6-f5c8ec24d426","year":2025},"citing_paper":{"arxiv_id":"2605.09591","last_updated":"2026-05-10T15:07:17Z","snapshot_observed_at":"2026-07-31T21:46:37.121236Z","submitted_at":"2026-05-10T15:07:17Z","title":"From Pixels to Concepts: Do Segmentation Models Understand What They Segment?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:38.800119Z"},"links":{"cited_paper":"/paper/2505.15435","citing_paper":"/paper/2605.09591"},"observation_digest":"sha256:531d9a04ea4b3c3cf8d6a294f2dcc697b0157279d18cdb643069233a688223c1","observation_id":"92a540e8-24c7-4946-8124-959cd2389bb8","resolution":{"observed_at":"2026-05-12T03:16:19.454729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15435","snapshot_observed_at":"2026-06-29T08:33:15.607500Z","title":"Timecausality: Evaluating the causal ability in time dimension for vision language models","venue":null,"work_id":"a5bbc6a7-8486-45d2-98e6-f5c8ec24d426","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2505.15435","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:f3e00b406a6b16f0befd8e08ad7dcb48617aa48a5ae408ef80ca2f4ce0cc7d9c","observation_id":"20fc5d2c-baf9-4347-b98b-1403ac5bea1f","resolution":{"observed_at":"2026-06-29T08:33:15.609088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15435/citation-record","integrity":"/paper/2505.15435/integrity","json":"/paper/2505.15435/citation-record.json","paper":"/paper/2505.15435"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:01.897899Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:01.897899Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:dcc54b936eb835bad01e9048f188196e8c4f0b8776dd6ddff65e5a57779c90ba","observation_id":"4f53eb2c-dbce-4ace-87fb-44ca5f2f7ef8","resolution":{"observed_at":"2026-08-07T15:21:01.897899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:01.996933Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:01.996933Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:6f1bdc95170b6de733d4690f2c0928846793fdcc1f38242e7e00ec6f2a6f542e","observation_id":"445f09ff-3a76-46d4-958f-f361391417ee","resolution":{"observed_at":"2026-08-07T15:21:01.996933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T15:21:02.062900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.062900Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:ea780dd57bf5385c11cf7ffbfe14a3b10b957a3b3b58ab348708d5d0108ab7b6","observation_id":"ec76e173-e816-46f3-8405-205f991a40d7","resolution":{"observed_at":"2026-08-07T15:21:02.062900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.955467Z","title":null,"venue":null,"work_id":"fb455b50-58eb-4e51-a825-0c5e474dbb56","year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.152467Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:5b177fc87daec54579a695729be2e842968f762e1eb05741e51f93a313c62b42","observation_id":"216d29cd-008f-403e-a699-f42533fd257d","resolution":{"observed_at":"2026-08-07T15:21:11.041649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.744106Z","title":null,"venue":null,"work_id":"0b1ed5c2-9d7d-42df-91ad-60cc8959d183","year":2015},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.218499Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:ad8e3e792ed62bc7283f871d0dd11d3477d24384901607130cdddf1af51d6cde","observation_id":"82beea28-e0a4-4388-b12e-4125d60ac75f","resolution":{"observed_at":"2026-08-07T15:21:10.849727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T15:21:02.331665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.331665Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:fb7d0a70861d507a055997c5eb41ffebb516e0cdef39c05cdc8e62a0e7743e57","observation_id":"1eeee35d-e988-49da-80b4-e3dd4127d940","resolution":{"observed_at":"2026-08-07T15:21:02.331665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:21:02.451677Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.451677Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0268ddf5782ca0afa397ea75ab8987956fea7b82190e123fdeb173ab6a12b165","observation_id":"84ef2487-92c8-432c-9b13-6db5082652b5","resolution":{"observed_at":"2026-08-07T15:21:02.451677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14378","last_updated":"2025-03-18T16:10:24Z","snapshot_observed_at":"2026-08-07T16:54:31.868932Z","submitted_at":"2025-03-18T16:10:24Z","title":"Impossible Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14378","snapshot_observed_at":"2026-08-07T15:21:02.536850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.536850Z"},"links":{"cited_paper":"/paper/2503.14378","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:359de4731601c6686b00c329be6803030a2aa7f0bc9fa49791af8e47b580e640","observation_id":"218cf0c3-5a73-418e-bf61-5a4c23ccf024","resolution":{"observed_at":"2026-08-07T15:21:02.536850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T15:21:02.707953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.707953Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:49142fe9d5d3651359543ff67e48005df66cfae6a3379ce79e266647057d4aa4","observation_id":"46e84066-4c31-4f17-98a7-79717af5cf07","resolution":{"observed_at":"2026-08-07T15:21:02.707953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:02.830991Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.830991Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:21231b53d4603e576d0c533025541766e49918147fbc7cd476c6d58a880a4a40","observation_id":"b2d305cd-1c1e-4c0b-8c68-62234e14ab57","resolution":{"observed_at":"2026-08-07T15:21:02.830991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.508222Z","title":null,"venue":null,"work_id":"1a6f8490-3aca-4cc0-b8e2-0fcdc9348cc3","year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.924684Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:24865b68854e490258e5a4e4b4fda0bf4ca54f8ca50e98d1eb8641133f45318b","observation_id":"7cedd5a6-3b1e-4b0f-a5d5-185d12943e0a","resolution":{"observed_at":"2026-08-07T15:21:10.613925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:03.030057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.030057Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:7f112fabe6b34e51cd11c51385a44df9b95cd03705e4d77a3602b49d25686189","observation_id":"af172295-76cc-4ba5-bf35-5d5561ae1910","resolution":{"observed_at":"2026-08-07T15:21:03.030057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T15:21:03.130746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.130746Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:a6b7c5c33a8b0bdc537ddedb1fdc1336a91589de0c49bd16a6a3af134685d6db","observation_id":"88f38579-9ced-4e65-abcb-f5c8ac69ea40","resolution":{"observed_at":"2026-08-07T15:21:03.130746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T15:21:03.249527Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.249527Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:b08a813adb20d84eb891ddcf75d619543dc212f58d7ea1dce23277023c061455","observation_id":"640635d4-8ae0-4327-8ef1-241b1eb24b0e","resolution":{"observed_at":"2026-08-07T15:21:03.249527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T15:21:03.535519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.535519Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:d123817c57f3607cd7d9826aede371fdb4a27767fbbc4666c1177b19607f356a","observation_id":"627fb513-bad7-4ea4-bda2-4b64db0c639f","resolution":{"observed_at":"2026-08-07T15:21:03.535519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.316634Z","title":null,"venue":null,"work_id":"dcc3c998-f5c2-4921-a3fd-de57168bf36e","year":2017},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.649848Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:c01e4e116ce75b5a63c6471b02e0129031dba0ccec90f615dbca17fb5c2f4de9","observation_id":"b7dd6055-5026-4b96-8b03-cb440ab0a84b","resolution":{"observed_at":"2026-08-07T15:21:10.392999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:21:03.788774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.788774Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:3b386915e6a87b76f4c59915e474f67b566968708cf85b82e2ec3167aee8fbee","observation_id":"f6aec4ef-04ab-44e1-9795-eac64d00109f","resolution":{"observed_at":"2026-08-07T15:21:03.788774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T15:21:03.895366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.895366Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:091a1fc5da22a63cafa0815afd254e4285c8e6a59e94e485fd39bf973440c591","observation_id":"2c8162b7-1d8f-42ab-954f-5ad194dd303f","resolution":{"observed_at":"2026-08-07T15:21:03.895366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T15:21:04.051014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.051014Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:589699d22a2aa6ca9b3163763559d2f371c2f7d4bb6c72d0a805709ff5b6b29b","observation_id":"6425c5f5-2628-4408-8271-946a7a686471","resolution":{"observed_at":"2026-08-07T15:21:04.051014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.085183Z","title":null,"venue":null,"work_id":"3415d569-c298-48e1-ac91-4c8e3bb32538","year":2019},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.163938Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:d04d061477926c850fac7b4b435f8d0b29b70c72019d5c88e69d297de87ece2e","observation_id":"954e36cb-c8dc-4f31-b379-aa5c102e721a","resolution":{"observed_at":"2026-08-07T15:21:10.199942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:21:04.260199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.260199Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:302e7bb5966609818d751d7bad4c546d7092f757dcf69a663003e4e89051361c","observation_id":"e6fc057c-dfae-4535-b908-ab7a9a896b29","resolution":{"observed_at":"2026-08-07T15:21:04.260199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.887019Z","title":null,"venue":null,"work_id":"9795ee43-be29-47b3-a8b4-78380d07d28c","year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.355966Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:cfcd3d2aee797e01121c343c64279f4b1244649a9419eece9b20c2aa847e6332","observation_id":"b8a9cbf2-4eda-4048-8a07-862490b3936a","resolution":{"observed_at":"2026-08-07T15:21:09.969323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T15:21:04.487040Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.487040Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:22e19f8314f2918e4e9c8e3c075accb32db90a067cbfc347b3374d995d366c4e","observation_id":"056bf031-8874-4873-a489-2bc26aa9f4c4","resolution":{"observed_at":"2026-08-07T15:21:04.487040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-07T15:21:04.593542Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.593542Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:74bcb42c93b5632658ed792bd6db8802443636fcab513f3c09a47d790b7f77ea","observation_id":"039e884b-22be-453f-a0e4-4a4d613024a8","resolution":{"observed_at":"2026-08-07T15:21:04.593542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T15:21:04.740070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.740070Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9e3bb31af802bb4d4ed11ebdcaa7df1ded53e17c179902f689601c18d2b392c2","observation_id":"c4e2eb9e-1707-4ee6-8b0d-b25d5b4162f7","resolution":{"observed_at":"2026-08-07T15:21:04.740070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:04.768471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.768471Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:84125a79e3c50c85d39a2809aa9bf638fafb8ec8d7c959cd40286f653d369ecc","observation_id":"44ba6a1e-313f-45b3-b17d-9e3b20c02255","resolution":{"observed_at":"2026-08-07T15:21:04.768471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17404","last_updated":"2024-09-21T14:59:07Z","snapshot_observed_at":"2026-07-06T16:54:14.216770Z","submitted_at":"2023-11-29T07:15:34Z","title":"VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17404","snapshot_observed_at":"2026-08-07T15:21:04.771148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.771148Z"},"links":{"cited_paper":"/paper/2311.17404","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0c0b470b356d684b65c3cc0715ab2a8c7f324631174c067285868a950f123c22","observation_id":"01a14c51-e559-4fa9-a653-a5299ebf00c5","resolution":{"observed_at":"2026-08-07T15:21:04.771148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09788","last_updated":"2024-09-15T16:45:42Z","snapshot_observed_at":"2026-07-06T19:15:38.913862Z","submitted_at":"2024-09-15T16:45:42Z","title":"Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09788","snapshot_observed_at":"2026-08-07T15:21:04.774658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.774658Z"},"links":{"cited_paper":"/paper/2409.09788","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:da9b3e756e5394d6b86cc3f34343abfdaa38bca9bf33c18a3229ae9e01818ede","observation_id":"6685021b-79d0-49b0-952d-3f044846202d","resolution":{"observed_at":"2026-08-07T15:21:04.774658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:04.851495Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.851495Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:dd223cd3b62c66d5bc768f2f68de81e33e64106f6d6d89e021949319f1e4a784","observation_id":"2cf8e1f9-7b5c-4f6a-a3ad-37cd939180ec","resolution":{"observed_at":"2026-08-07T15:21:04.851495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:04.947994Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.947994Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9b1fcd6ffa2b1cf3cfc64b915dcd42e6a372957b3c41179d34ab09da42ce3736","observation_id":"d63b1fd5-9a45-46a0-aa97-d76e1dcfb7e6","resolution":{"observed_at":"2026-08-07T15:21:04.947994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T15:21:05.036615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.036615Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:b8f64c9f5eaf17aed046b3230f6157e9e8937c07a697c53396479097ca619bb9","observation_id":"b6dcae9b-d0dc-4923-b60d-f7b60375cf58","resolution":{"observed_at":"2026-08-07T15:21:05.036615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.691460Z","title":null,"venue":null,"work_id":"89ffeaac-8b7a-4af9-9964-642e4ff7ef3a","year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.161689Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:7ff8eb80ba563e80b16a54a0fb3d65c6c235d93aa2cd37013f08694ee060f32e","observation_id":"145cc998-7cf1-4a90-a99a-40d80a77bff8","resolution":{"observed_at":"2026-08-07T15:21:09.788787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.442009Z","title":null,"venue":null,"work_id":"243dadd2-fb92-4c99-8fc0-90690e6a7d7b","year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.246434Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9e5da208ede0791eac2b0050584f99dfb7bd09f96325e438c3918038e9ab6aa0","observation_id":"e2947ecf-9fdf-4ebe-a753-c19a0cae9a71","resolution":{"observed_at":"2026-08-07T15:21:09.612225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-09T05:13:18.023230Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-07T15:21:05.372302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.372302Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:07ab12983debba7545c5b59ffe7dc9a78ae4021b3270175e1d3ba21e286eadca","observation_id":"13d25a94-f9e4-46f9-ac01-cb6142da07aa","resolution":{"observed_at":"2026-08-07T15:21:05.372302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T15:21:05.497735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.497735Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9848598de439f14d005867695e9b19bf5b800517abdb97042b8f5dc024deee94","observation_id":"c9c0aa41-0ace-4d52-82ef-682ec8b0919c","resolution":{"observed_at":"2026-08-07T15:21:05.497735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:21:05.685566Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, and Others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.685566Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:cf6c876d65dd48c051753940e720127f18e0e0bfe29f49f1dd1657e49d632817","observation_id":"0d77b8db-c044-4b64-a8d0-1211e6dffdc6","resolution":{"observed_at":"2026-08-07T15:21:05.685566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.210547Z","title":null,"venue":null,"work_id":"ff4c1510-7f57-4d8d-85c8-c0162b8a500e","year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.853733Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:ebf1320ec3f00c55cc3ed388bd63124d3183d3b0a4ebc71a691eaf1420dfc6c1","observation_id":"14412af5-64c2-4158-9c1d-75ba21a59604","resolution":{"observed_at":"2026-08-07T15:21:09.297461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:05.940815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.940815Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:a2f954a3f9abd77932fa3c7b0c9b1bb78aa4bfa7065d2a87c226b11d739d83d4","observation_id":"e3ba647c-9f9c-434b-ae3b-6306d600074b","resolution":{"observed_at":"2026-08-07T15:21:05.940815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:21:06.071552Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.071552Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:c62650526689ce5034e61c88e85e2f682a101da0926cb43aced59652c67eaf6c","observation_id":"9d5be64a-5744-4655-9384-60088d952b7c","resolution":{"observed_at":"2026-08-07T15:21:06.071552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:06.267102Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.267102Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:f927048276de0c5c60c13acf1a39d8a4df9b7a0928d7d426a54ec9b6550b1efb","observation_id":"69230039-c42b-44ae-97a2-ba8355cd7fa9","resolution":{"observed_at":"2026-08-07T15:21:06.267102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T15:21:06.449932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.449932Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:742220c37ccda89aeef65ec0aa39898c25de35f9e50d77fb787a99477c3bf231","observation_id":"39ca58c8-aa14-4b82-af06-792237eff944","resolution":{"observed_at":"2026-08-07T15:21:06.449932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:06.641219Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.641219Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:561be5ac6647f81f8aff22a6989a0266a7a80376370de03e30a0b995573f7af6","observation_id":"c628ca5d-3a85-40cc-a750-e34bee2d160f","resolution":{"observed_at":"2026-08-07T15:21:06.641219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05091","last_updated":"2024-07-02T12:46:23Z","snapshot_observed_at":"2026-07-06T17:56:53.470829Z","submitted_at":"2024-04-07T22:16:50Z","title":"MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05091","snapshot_observed_at":"2026-08-07T15:21:06.787806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.787806Z"},"links":{"cited_paper":"/paper/2404.05091","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:1445411d61031c568b7c694a1f91fa0b17d1da6262ce808705beec50242ef5eb","observation_id":"c8035537-ae48-42e0-894e-0e6c16c842ce","resolution":{"observed_at":"2026-08-07T15:21:06.787806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:21:06.920302Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.920302Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0fc4420c0e7a3ae8dacb448ee674cece69be7ba0d310b255eb7765036fb6153b","observation_id":"8128d2ce-0dd0-4952-8a67-5aa1b8cc6633","resolution":{"observed_at":"2026-08-07T15:21:06.920302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:21:07.073488Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.073488Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:e118eb4904a1781210b8c5134ad1a34e1a72e9086544633996fb41808c6f3745","observation_id":"543de62e-338d-4339-b276-26a66aa69b8a","resolution":{"observed_at":"2026-08-07T15:21:07.073488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T15:21:07.243953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.243953Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:3df61451f678a9deae3fb8d2eb9849fe1923dc5c9eac3d9e243cd1f7045b2e09","observation_id":"573f87b1-67c5-4310-a457-7bf36f630d62","resolution":{"observed_at":"2026-08-07T15:21:07.243953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T15:21:07.416688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.416688Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:7a64aa6aba834a6efe3fa04b9b46e789b0b086eb7a0a8d65d7b9fee4dab572d9","observation_id":"cd21bd03-7f4e-4771-9884-933151047622","resolution":{"observed_at":"2026-08-07T15:21:07.416688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:21:07.549870Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.549870Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:891653e521540fa6eb16e2356c3fb32332f8342613c85b9ddcdb311a792092b7","observation_id":"37dbdc00-6367-425e-b14a-eee599f99ee6","resolution":{"observed_at":"2026-08-07T15:21:07.549870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:21:07.684945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.684945Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:2517562b58f4c1282333aac64d0380630a4fa9d2ebe01893cc7938704940cfb1","observation_id":"5ec21d43-91b3-4b21-9237-23bd9a1de64b","resolution":{"observed_at":"2026-08-07T15:21:07.684945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:21:07.899523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.899523Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:b2bd9f2e40b9d2e01367f374b9128cc8cadcc4a745bf1bab7c7d938e3654fca0","observation_id":"162343e5-fdec-4c9c-ae9e-583fe6c9d36c","resolution":{"observed_at":"2026-08-07T15:21:07.899523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T15:21:07.985252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.985252Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:715da19259ca65197d46965b32f5fd5e03739f17fac587e6c54d2f7b9ddbee4d","observation_id":"b0c334f9-a71c-4719-bc39-c65cc679c070","resolution":{"observed_at":"2026-08-07T15:21:07.985252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.918042Z","title":null,"venue":null,"work_id":"8452556d-b28b-4e72-8732-94dfb721f147","year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.048218Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:cc427fe82fb1063c53cbfbbc08f075981fc2ffc5ded071edd64b37d20027bcdc","observation_id":"e4d64376-76fc-4b58-93b1-2a35352addf5","resolution":{"observed_at":"2026-08-07T15:21:09.049188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.112320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.112320Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:5b3ab78b95c4eccec2e52da2b967a7a9e3c12d37a4b89efdb38f2e141d95453c","observation_id":"dede3df7-5bb3-4c2a-b94a-6c6bf08abb6e","resolution":{"observed_at":"2026-08-07T15:21:08.112320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-07T15:21:08.213812Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.213812Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:f01278c4692cdd4fb0cd2f2882cb79953c1a0dac85c87262582ca85fa1648b5d","observation_id":"b0fcdb82-19b4-4dd5-b49d-b51c72537f1b","resolution":{"observed_at":"2026-08-07T15:21:08.213812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T15:21:08.281191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.281191Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:f5d8c95b584b64294d99ce63c40e17704e42ee7a973c0578e6e75b28a5c1c950","observation_id":"0ac36fb2-ab8f-4be9-878b-df0d6c8add89","resolution":{"observed_at":"2026-08-07T15:21:08.281191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.369899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.369899Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9897de479731df344a5d42572d96e5fabb80f3a111985d33e9f4f2a0653b3cd7","observation_id":"a1a76945-8ea5-4931-b5ae-9afcd0d1d78b","resolution":{"observed_at":"2026-08-07T15:21:08.369899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.464980Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.464980Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:687671592c410744479b2b32160cbea902adec61c75ad74049717225b07fe701","observation_id":"671bbe9c-b429-4adf-8e61-d18d895d741c","resolution":{"observed_at":"2026-08-07T15:21:08.464980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-07T15:21:08.559862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.559862Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:6ff0f9eca41e95fffa7aa0c387b684ffbf57c336d2405c9836c5544f1a1edef4","observation_id":"5ae7bb7b-10ed-462e-908c-fd816a7b30b4","resolution":{"observed_at":"2026-08-07T15:21:08.559862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:13:36.452846Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 3 inbound Pith citation observations for arXiv:2505.15435."}