{"as_of":"2026-08-14T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88065ee7d6fe0d730e45cbb30c0648daf90b1c7a599443dafe5d3f8c8fd4c54a","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:58:08.643991Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00928/citation-record","integrity":"/paper/2506.00928/integrity","json":"/paper/2506.00928/citation-record.json","paper":"/paper/2506.00928"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T11:58:08.065790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.065790Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:89de8db901bf22d41816c178e0ac815917ee824056132f5cb27dab08e5f4405c","observation_id":"661074a2-ba1d-4c2a-bb75-d26358803388","resolution":{"observed_at":"2026-08-07T11:58:08.065790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.745830Z","title":null,"venue":null,"work_id":"9d080487-487f-4824-ad1e-74ddd1cc922a","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.079290Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:af72311915c7b5cc535d878b347abed0384aa7ecdefbc8b279f278fc1633ce6f","observation_id":"6fbbaa43-276b-4ea5-8110-f20991041e7c","resolution":{"observed_at":"2026-08-07T11:58:10.753863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T11:58:08.090193Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.090193Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:27c2e3ff1782a9d18703fcf447b0416fc165f46abd8dc918796d291825270b80","observation_id":"f205f64e-d814-4608-b617-3f2535bf5cc7","resolution":{"observed_at":"2026-08-07T11:58:08.090193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.702602Z","title":null,"venue":null,"work_id":"89e09fbb-20e5-42f1-902a-421b4112b7e2","year":1984},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.100925Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:887d76261d55007bd5f38af0fef9a6e80cf8e1919717333a413d094a42427836","observation_id":"8149cf40-87c9-4658-8393-38ccfb40a981","resolution":{"observed_at":"2026-08-07T11:58:10.712770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T11:58:08.107125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.107125Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a43408337d9edbace64e469398d4e72bfa03b7444967fa32c9e8857e437992e6","observation_id":"1f05cdf1-6cb3-4bc6-b8dc-6e29a695e0b9","resolution":{"observed_at":"2026-08-07T11:58:08.107125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3765/elm.1.4880","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Bosch, Mathilde Chailleux, and Francesca Foppolo","venue":"Experiments in Linguistic Meaning","work_id":"bb857b87-7c7d-42ab-b694-4f4ab08a3a29","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.113594Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:7dce03703fee267dc688d41c367944ced5c52c4776391633860be0ec843ae678","observation_id":"190c08d5-ef08-4c04-bad2-3aaafccb369c","resolution":{"observed_at":"2026-08-07T11:58:08.773160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-12T22:23:25.864838Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T11:58:08.121411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.121411Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:29f06bda5ca9b26b4f3878c1194298ceff20b6ff714e87bda856ec5893e3505c","observation_id":"305f6973-6c73-49c7-a805-d19b14918540","resolution":{"observed_at":"2026-08-07T11:58:08.121411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.672889Z","title":null,"venue":null,"work_id":"ebf1b448-317c-4e84-bcaf-749f97ebbc8a","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.137586Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:0cd36aa3cb6075ef3633291b99d06f8be0f0853551450cec6df715ef8cb7593e","observation_id":"5174ea98-94dd-4396-b95f-d4ecb38eeee4","resolution":{"observed_at":"2026-08-07T11:58:10.684219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.148172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.148172Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:3b89bb2eb54994e4f5897e2e242ff97c79164543e1d8bae71a4d7a04e4b9468f","observation_id":"45f4a0c7-581e-43c9-9e16-0f09708d677b","resolution":{"observed_at":"2026-08-07T11:58:08.148172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T11:58:08.163052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.163052Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:862c1f8ef5537d9eb1a052eb753b881b994cd6291c56c5c113fe476780ad7327","observation_id":"7af4940d-214d-4cf0-b8e1-93b564dfb6be","resolution":{"observed_at":"2026-08-07T11:58:08.163052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.169555Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.169555Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:dae4750029059ec0729eba79563bfaf36751ea6d7d5cf149cc7fa404f7cc1e70","observation_id":"780dd187-28cd-426c-b1c3-4b8d4be3d655","resolution":{"observed_at":"2026-08-07T11:58:08.169555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T11:58:08.177631Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.177631Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d8ed2ad07b9c95de1a6fb6a7bb3e2baeafdd908887ea02790822ccbb9ecd198b","observation_id":"b3ea757f-cda6-4708-969b-56f7866b53d9","resolution":{"observed_at":"2026-08-07T11:58:08.177631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.605744Z","title":null,"venue":null,"work_id":"0c507f88-e7a1-4b78-a22c-6509d4843fc0","year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.185701Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b09a31ab77b3912827125e059ce098a67553d7c884387a1584bbf066b59f8a50","observation_id":"abe87411-74c7-4815-b49a-6688ee090634","resolution":{"observed_at":"2026-08-07T11:58:10.613626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.580701Z","title":null,"venue":null,"work_id":"c6ce1e5e-c2f7-4b36-af56-d4b4a2b3235a","year":2020},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.194140Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:99465ebc692efbc6b938b8e6868421ef9dbf65401b13a33c868340b36bf60827","observation_id":"ea391800-8fe8-4cec-ac86-e26b7f1da069","resolution":{"observed_at":"2026-08-07T11:58:10.589722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.541896Z","title":"Bosch, Ciro Greco, Maria Nella Carminati, and Francesca Panzeri","venue":null,"work_id":"8625a964-f325-4ee2-901c-d51bf87fa54e","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.205597Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:41540218eeb089f37448b185e30cf8dda00c7b6173a27ce8689d7416387f4d09","observation_id":"a67c9357-e855-4797-a47e-c00cf4454665","resolution":{"observed_at":"2026-08-07T11:58:10.548424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.505288Z","title":null,"venue":null,"work_id":"a25c98d6-7ab5-4f96-8697-8b6eb287d52d","year":2016},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.222972Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:2b4c7bf3dcbd433b5be6c12b5670ed7e653fb84d07d6cfb1080ff7439742f078","observation_id":"3123e7e9-6174-4333-8504-59bf6df14862","resolution":{"observed_at":"2026-08-07T11:58:10.511873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:58:08.229550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.229550Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:47da8cccd8d810788e56e86bcecb8edfa1550599f4217197e1f12871db13cff5","observation_id":"88f3d769-d1dd-4af2-870a-aa6bc7679af3","resolution":{"observed_at":"2026-08-07T11:58:08.229550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.243662Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.243662Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:19b2eb5a2a889058ed55f03e5801d834e92b969a1623085575aea60be641878d","observation_id":"33d5291c-fc49-4bb6-ac6b-ff35595f70e3","resolution":{"observed_at":"2026-08-07T11:58:08.243662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.444761Z","title":"Jang, Yale Song, Chris Dongjoo Kim, Youngjae Yu, Youngjin Kim, and Gunhee Kim","venue":null,"work_id":"8e87b7f4-c301-410c-9fd5-275b6d4af48e","year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.251953Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:3907c92e97f47bcd5522f047fd492e7c2e023f5bdcd31976d55b0a76869a87f5","observation_id":"88dececd-f3ee-419b-8eab-d98ae24b3419","resolution":{"observed_at":"2026-08-07T11:58:10.452676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.402631Z","title":null,"venue":null,"work_id":"71fce54d-b557-4981-995a-f3e41eb68536","year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.261181Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:991f9302ba631b13626502a518d43737a8494c5d477a3f7684693f6b3221c05e","observation_id":"101a6953-0694-4eef-9cb4-f98d0e2002ab","resolution":{"observed_at":"2026-08-07T11:58:10.409327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T11:58:08.269901Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.269901Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:3a9c717f9d43997bc9ca723f5a3f7efe9fd854e1efa0210e640a8d56efa6f8c6","observation_id":"7a86d6d0-763f-4431-9bb2-a47548082387","resolution":{"observed_at":"2026-08-07T11:58:08.269901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.373098Z","title":"Richard Landis and Gary G","venue":null,"work_id":"2c194f2e-3806-46db-8366-e93e5a48071c","year":1977},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.279360Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:acdc4f52475c92ed0dab677da15aafbf0dac19fcf09d7d18242d07e6efac1344","observation_id":"8ab32041-ba94-48b4-9e0e-184aec77ae79","resolution":{"observed_at":"2026-08-07T11:58:10.379407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.349205Z","title":null,"venue":null,"work_id":"1486567a-0ada-493d-a6b6-07adad978872","year":2018},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.294485Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:1496b091eea4b32e89e93333a800832e50820013399a7fe5fcdcd3411af3d201","observation_id":"6ba89717-7e6b-444d-8765-2e136566d15a","resolution":{"observed_at":"2026-08-07T11:58:10.355305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.317645Z","title":null,"venue":null,"work_id":"72e64724-0083-4d71-b325-5f2f5e6891e9","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.304150Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:6eaa785ad445cae003161b4658a59fe044659b269b1a1e7ca4ba9c91a55814b3","observation_id":"8d77b7a2-50c7-406a-9503-d99203cf17a7","resolution":{"observed_at":"2026-08-07T11:58:10.328245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.293011Z","title":null,"venue":null,"work_id":"361c6f53-e82b-4e0d-8e0e-890a1eeda5be","year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.309019Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:231edd87f996d103a1564f150eefc23c9fa5eae87211861965e102e2a007dca2","observation_id":"84b0703e-e012-4999-b0df-827ebc4bc01f","resolution":{"observed_at":"2026-08-07T11:58:10.299380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T11:58:08.318031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.318031Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:96cfe9ac5f04e8736d92ff26faf55784adcff11f27a0f8dc829c3c84db9dbae5","observation_id":"dbb4b5e4-3a7e-4e76-b17d-325ebe888241","resolution":{"observed_at":"2026-08-07T11:58:08.318031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.260787Z","title":null,"venue":null,"work_id":"1bbd2030-3f19-4ef0-8e6d-a4692a89b7bd","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.326369Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:c210804e39e600f20294cc785c3158eb1942354aebf6239bcfefd33a3f033bda","observation_id":"003702f3-d3bb-4edb-aeea-0450b3168719","resolution":{"observed_at":"2026-08-07T11:58:10.270819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T11:58:08.340059Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.340059Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a634fc647113839c7fb2dee438ca6bc317cbde83e8f9f0c692d11b910344a441","observation_id":"eda7a662-bae1-4f30-a5ad-1902a40b912d","resolution":{"observed_at":"2026-08-07T11:58:08.340059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14248","last_updated":"2025-05-30T17:01:57Z","snapshot_observed_at":"2026-08-12T22:20:18.705098Z","submitted_at":"2024-10-18T07:52:22Z","title":"Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14248","snapshot_observed_at":"2026-08-07T11:58:08.355931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.355931Z"},"links":{"cited_paper":"/paper/2410.14248","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:1a7e4b1c398cfec986b76a1e1708bafcd02b37231358c7eb1ae0123fd3f9123f","observation_id":"57753b8c-62ef-4678-b831-78e636faa163","resolution":{"observed_at":"2026-08-07T11:58:08.355931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02910","last_updated":"2023-07-06T10:52:22Z","snapshot_observed_at":"2026-08-13T11:01:02.689751Z","submitted_at":"2023-07-06T10:52:22Z","title":"Agentivit\\`a e telicit\\`a in GilBERTo: implicazioni cognitive","version":1},"cited_work":{"arxiv_id":"2307.02910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02910","snapshot_observed_at":"2026-08-07T11:58:09.246182Z","title":"Agentivit\\`a e telicit\\`a in GilBERTo: implicazioni cognitive","venue":"cs.CL","work_id":"d2c37e33-ce03-4417-9bbe-d964c8367f3d","year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.363088Z"},"links":{"cited_paper":"/paper/2307.02910","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:885ccd195881539502d56862f5a69930704d10c47932c870e55099b91f7a0bc7","observation_id":"77c7fac6-a0ae-4e54-812f-90d8282ef350","resolution":{"observed_at":"2026-08-07T11:58:09.253700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T11:58:08.371169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.371169Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d98bbc0e20fa758a2fa7b707e9094e80d1e079d897f615ee6b76342c22e0dfaf","observation_id":"df6d49b8-2b3a-4ee0-aa00-408b69daaa68","resolution":{"observed_at":"2026-08-07T11:58:08.371169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.cmcl-1.10","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"81bc41af-8554-49a8-9212-2f99fad413e8","year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.380118Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:aaf874ad6334f6624fefb0b52a4ac8bac27ebe982462ec729941f7abbe06000a","observation_id":"7f14d5e1-ef21-48b7-91bb-e9ded914a0e7","resolution":{"observed_at":"2026-08-07T11:58:08.730314Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.229101Z","title":null,"venue":null,"work_id":"ce6466ba-7a36-400a-8b99-5200dad40211","year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.391886Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:929e64cbdff9fe9119ae002859d56e157c6917c156fee848730c3e1cc419caf9","observation_id":"65869796-290d-4a5f-ad21-318311b7bf4b","resolution":{"observed_at":"2026-08-07T11:58:10.240152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.189469Z","title":null,"venue":null,"work_id":"698c8a62-acf5-49d2-90e5-3650f5a34c35","year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.398684Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:9940a4c94ca4fd8400e54b774ea963a63dc844872f8b8af0823219d7194a4343","observation_id":"d6e8a864-4a98-46ec-9279-f20853c0ec43","resolution":{"observed_at":"2026-08-07T11:58:10.203402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.154880Z","title":null,"venue":null,"work_id":"a907b700-8da9-4810-afe1-2246cae08881","year":1988},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.405770Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b0c2956bface6f7b5e229a3873416592ae86205bd0e9dceb38c3b6a830f76a14","observation_id":"357174b5-9dd7-47cb-931d-64eadb196113","resolution":{"observed_at":"2026-08-07T11:58:10.163004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.414163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.414163Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a034805946c462bb9b630a6ff7ca976ca2bcb34d8278448dc4d303296c093a6f","observation_id":"5814384c-e745-4a4d-ae37-4a4db5be6698","resolution":{"observed_at":"2026-08-07T11:58:08.414163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.420869Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.420869Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:ad3be60fc58d41f46e8d581f3834b280883379b492b23f733ce0cd210948224c","observation_id":"97b4ab7a-f919-43e0-b666-cb0904b0fbda","resolution":{"observed_at":"2026-08-07T11:58:08.420869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:10.047151Z","title":null,"venue":null,"work_id":"9a53718b-f5b5-44b4-b27d-cf10999cd897","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.427772Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:ec738bb869bad72a87522315938f68ceec51065c54931a4c074ab38ef0869d70","observation_id":"9911d2db-23b7-4b05-af9d-22fde91c33ed","resolution":{"observed_at":"2026-08-07T11:58:10.067753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.992110Z","title":"Anwer, Tim Baldwin, Michael Felsberg, and Fahad S","venue":null,"work_id":"fd9df57e-eb32-4f78-b189-5e5cb756183a","year":2025},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.437777Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:b21377125237104d6246d703412727f384afad4420661fe62eeab68c31c76a74","observation_id":"8a725ab7-a015-451f-beec-04fa9aeb1814","resolution":{"observed_at":"2026-08-07T11:58:10.011609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03762","last_updated":"2021-04-08T13:27:43Z","snapshot_observed_at":"2026-08-13T17:05:58.772477Z","submitted_at":"2021-04-08T13:27:43Z","title":"Video Question Answering with Phrases via Semantic Roles","version":1},"cited_work":{"arxiv_id":"2104.03762","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03762","snapshot_observed_at":"2026-08-07T11:58:09.179045Z","title":"Video Question Answering with Phrases via Semantic Roles","venue":"cs.CV","work_id":"0f8d6a1b-0b3e-4272-a6c9-aaabc5629e18","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.449747Z"},"links":{"cited_paper":"/paper/2104.03762","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:851d5fa5f000ebe1388875bf82c881e71a58eea9ca4d3f7079d8a0e502433301","observation_id":"3b6ff0a6-05be-4876-a83e-04b6bbee94d9","resolution":{"observed_at":"2026-08-07T11:58:09.185982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.962436Z","title":"Sigurdsson, G \\\"u l Varol, X","venue":null,"work_id":"60fb2ad1-72bf-421d-8c6a-03e33fdf76ef","year":2016},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.463803Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:dc460975f16c1d270e93706a0af61c0cd89be864021039ec4bd0c29ec3d02617","observation_id":"7b4c77ae-1998-49f9-96b9-b7dfba8e7405","resolution":{"observed_at":"2026-08-07T11:58:09.970795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:58:08.473338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.473338Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:6f2cfbd35ae701cc9fb5ca70765c9b8efd57e721ad1900c7d7695a45ea9ce1d5","observation_id":"47f487db-cb26-4286-83b1-8ad8e5541a67","resolution":{"observed_at":"2026-08-07T11:58:08.473338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.934928Z","title":null,"venue":null,"work_id":"df601b26-594f-49b7-ab86-2745663b4477","year":1994},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.484690Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:873bb9457a0b86685d74c2045962ecbc6769fb5817c108a8d8cdf06820d6744c","observation_id":"99e957c6-d17e-40dd-832f-b4d4bd4c4be1","resolution":{"observed_at":"2026-08-07T11:58:09.940208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:58:08.490321Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.490321Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:4e7279f3dd367991e90f5f534a96c70949e7961ee0c8f52434424d11134f789d","observation_id":"6f28e24c-fd11-4442-b9a1-5dc98113b0fe","resolution":{"observed_at":"2026-08-07T11:58:08.490321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.897351Z","title":null,"venue":null,"work_id":"8aebdcac-fb20-4e3e-b305-3378f3f8d33d","year":2008},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.498573Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:7563ec365b44e8a68e8d67620feb6c25a547a3c4b2959af2577416e5edf5ad21","observation_id":"f9412774-1016-4c9d-ae3d-b17c4d922938","resolution":{"observed_at":"2026-08-07T11:58:09.907561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.867283Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"cbfa9d46-29e1-463d-9812-37538fec7069","year":2017},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.509837Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:7b8debba6ceeb514b4030bf099beff545f68b019496e4a5f474525f201f895be","observation_id":"142db803-8e86-4a28-bcc5-e8239baec08e","resolution":{"observed_at":"2026-08-07T11:58:09.879043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:58:08.520364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.520364Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:832d1115a35b4f9d1f886cc570b77477bb139d9616075639a57de7193fa8b8ac","observation_id":"71817efc-3217-43ed-ad6e-3f631e95fc82","resolution":{"observed_at":"2026-08-07T11:58:08.520364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.838364Z","title":null,"venue":null,"work_id":"aafc8118-f49f-4c86-9f46-62ca08a8769e","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.531169Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:573690cf6bb4db84f86bc2283ec58df65a2620749b105fc05255f1bbfccacfe6","observation_id":"3a903595-c68d-4c9e-9d41-4151345d5212","resolution":{"observed_at":"2026-08-07T11:58:09.844726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05040","last_updated":"2025-06-30T07:41:07Z","snapshot_observed_at":"2026-08-07T16:07:58.938906Z","submitted_at":"2025-04-07T13:05:09Z","title":"InstructionBench: An Instructional Video Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05040","snapshot_observed_at":"2026-08-07T11:58:08.540817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.540817Z"},"links":{"cited_paper":"/paper/2504.05040","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:799a3dbd9d39f1127115736cbebc9ffd193360e1615472e7ec4f6f3f6d68ae7c","observation_id":"7de2259f-8e1f-466d-8cfb-4bea5307059a","resolution":{"observed_at":"2026-08-07T11:58:08.540817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:09.804484Z","title":null,"venue":null,"work_id":"38a710fc-0c09-4261-9187-2702d32f9f1d","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.551390Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:32126d4d29c5aa469546702b7ad9ad90f2fafa6c15bc4debb63f87a6a69f05ec","observation_id":"73c04c96-407e-490a-a3fd-f5f0974c377e","resolution":{"observed_at":"2026-08-07T11:58:09.813619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.559129Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.559129Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:cf6a6a773bd0209ff4ef7e52b3021582eec50d6e4fb1cd2aa5a61b133663a2d2","observation_id":"f87a7a24-3391-4e34-ad8c-22d14662f196","resolution":{"observed_at":"2026-08-07T11:58:08.559129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.572193Z","title":"Xu, Zhou Zhao, Jun Xiao, Fei Wu, Hanwang Zhang, Xiangnan He, and Yueting Zhuang","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.572193Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:d586d452ed43950988dbeb32ea18208c60abae929536472c8622fe382fc6e901","observation_id":"dfd73e6f-180f-468e-9b48-2121b184fcd2","resolution":{"observed_at":"2026-08-07T11:58:08.572193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:58:08.580265Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.580265Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:77ed49e171d0e4673ab0ccb21756a0d57c752aa453a4faf85e796e291ba124dc","observation_id":"583eb29f-cf09-4dcb-a04d-1b18f0d70251","resolution":{"observed_at":"2026-08-07T11:58:08.580265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02467","last_updated":"2019-06-06T08:08:14Z","snapshot_observed_at":"2026-07-06T07:58:24.206559Z","submitted_at":"2019-06-06T08:08:14Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02467","snapshot_observed_at":"2026-08-07T11:58:08.586217Z","title":"Xu, Jun Yu, Ting Yu, Zhou Zhao, Yueting Zhuang, and Dacheng Tao","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.586217Z"},"links":{"cited_paper":"/paper/1906.02467","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:1a6db842561fcd3b79edbe925a9a7cb2abd8a95d79aa758d32a855b54dbdc7fa","observation_id":"0f910687-a0df-43de-a1f3-02378c2032ba","resolution":{"observed_at":"2026-08-07T11:58:08.586217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16153","last_updated":"2025-01-26T15:34:59Z","snapshot_observed_at":"2026-08-12T22:59:25.550697Z","submitted_at":"2024-10-21T16:19:41Z","title":"Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16153","snapshot_observed_at":"2026-08-07T11:58:08.593276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.593276Z"},"links":{"cited_paper":"/paper/2410.16153","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:0af3c08820849ac84ba071797154442b70df4c2b5e11890baf8ac47ebed74d38","observation_id":"4a733a98-b3dc-49d6-b2e2-f4ad12fd0db0","resolution":{"observed_at":"2026-08-07T11:58:08.593276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T11:58:08.598707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.598707Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:1c78f7a02f18af77781c63fb265e7cb159e2d49d0a3ea0bb7ae05fdb65534f61","observation_id":"a858a6da-6e70-4864-8619-3aaf6e95981d","resolution":{"observed_at":"2026-08-07T11:58:08.598707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T11:58:08.604138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.604138Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:c392c5abdccfab8eaaaa2fedb7e6e69c31da28a5d682941094893c8df8f37afc","observation_id":"5762f209-5a99-4b11-9c1c-55cd14564bbe","resolution":{"observed_at":"2026-08-07T11:58:08.604138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.conll-1.6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"cf1307cd-f2ed-48fb-bcb0-e42a62110b98","year":2021},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.611110Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:576fe04d37e63378c66a3637ff6915e24100496d2cf23bd7b1c27dfd78f46d5f","observation_id":"41957909-cf19-4920-ac01-d848ae17fb67","resolution":{"observed_at":"2026-08-07T11:58:08.704124Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-08-13T16:30:43.637444Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-07T11:58:08.626602Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.626602Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:684976b98e6a675d5c0b8c4b2844f6f0f32db3fd6359cf52b2965906c3766ab3","observation_id":"8896bb95-5376-4b02-a7d7-7c0f7a5e5aa9","resolution":{"observed_at":"2026-08-07T11:58:08.626602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.634847Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.634847Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:a1defbf397e544296356940430c4c76b63a5351e20a474fac2b85fe0b7af5ae1","observation_id":"f4ff0b5f-be66-46ea-94b5-cd49718bdd99","resolution":{"observed_at":"2026-08-07T11:58:08.634847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:08.643991Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.643991Z"},"links":{"citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:cd866bd001b240067ae174b8aac30789a1ede6261baa8494e45fe852e0587044","observation_id":"7ee018d2-2192-4ea8-be87-1c20cc788438","resolution":{"observed_at":"2026-08-07T11:58:08.643991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:33:09.846402Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":5,"verified_fuzzy":6},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.00928."}