{"as_of":"2026-08-09T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:323c8dcec0208b39e64daacdf6bc0891aca52aa5883ba4aea60a38528f9ac1a8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:33:32.602468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":22,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:ccf55e474d4c5484c62dc4395dd784f530c94a7fc93103e6e965eb7f26d4b562","observation_id":"2c6edefc-924a-4814-96bb-d0ab6ccd99b4","resolution":{"observed_at":"2026-05-11T06:01:53.971264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:dfbe47843e17fe990a690bc77882edc3bc36becdee56ca63ce5f4a84d6d7d16b","observation_id":"de30d0f5-b527-42d3-bfed-85727a24d0ad","resolution":{"observed_at":"2026-05-10T23:20:32.807920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a11e56437858f76fa846105f5299ff5dccd4afd6ac96456420c8e11e8ccb7d05","observation_id":"64665e60-14af-4d31-81d3-bcfef72206ec","resolution":{"observed_at":"2026-05-10T13:23:58.156138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T14:33:32.602468Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18605","last_updated":"2025-05-24T08:59:28Z","snapshot_observed_at":"2026-08-08T00:45:48.179953Z","submitted_at":"2025-05-24T08:59:28Z","title":"Rethinking Causal Mask Attention for Vision-Language Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:32.602468Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.18605"},"observation_digest":"sha256:2367e9eace2c32b85568a3c26a2ed3cd905b3cb135527b30ddc5a4581fffea99","observation_id":"062db950-583c-4fbb-871d-02d519762ad8","resolution":{"observed_at":"2026-08-07T14:33:32.602468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T12:40:46.242481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:46.242481Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:94cd35624f3484d041dc80ae79e4d27c5c6790484307e09667e63b13424561e0","observation_id":"7ee1a5e5-7b2c-498f-90ae-a196f9785ab4","resolution":{"observed_at":"2026-08-07T12:40:46.242481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T12:22:13.702673Z","title":"Star: A benchmark for situated reasoning in real-world videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-09T05:12:16.591061Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:13.702673Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:09a97212afeb34e761a374f7ebd4484a5611e39ea2fce0b54651146c24da80d5","observation_id":"b23e32ea-f4c2-45bd-a21a-5b55d020807b","resolution":{"observed_at":"2026-08-07T12:22:13.702673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T11:29:29.288871Z","title":"Star: Structured action understanding in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-09T00:23:41.166151Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.288871Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:e123ac52287e34019e7e7cae13ce9c80d3c076512003e4d07352446d6cccdd74","observation_id":"759cfd64-7b93-4d6e-9e2e-1b9fa7556250","resolution":{"observed_at":"2026-08-07T11:29:29.288871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T05:49:53.357596Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.357596Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5524d75907c8f02e0cd24df9de60117c05d71c1e2e7bc34d3e746cddedf8558b","observation_id":"28fd6f61-85cf-4000-9df3-5bdea4755f80","resolution":{"observed_at":"2026-08-07T05:49:53.357596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:54:24.595020Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09445","last_updated":"2025-06-11T06:52:31Z","snapshot_observed_at":"2026-08-07T04:45:44.440916Z","submitted_at":"2025-06-11T06:52:31Z","title":"TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:24.595020Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.09445"},"observation_digest":"sha256:d6f3a4a30f917c637f55bad73bf958ce6ed13f24df7e5f12b3f28a15c54ad281","observation_id":"b0beb357-0bc5-4803-9b93-2e37a27c3837","resolution":{"observed_at":"2026-08-07T04:54:24.595020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:22:56.051254Z","title":"Star: A benchmark for situated reason- ing in real-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T13:30:57.844783Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.051254Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1089224d1e7839727df151610f47d42ced0978f0980e79366926fba78dc9348f","observation_id":"9a8e578c-f3ed-4db6-b45f-5eba1d035eca","resolution":{"observed_at":"2026-08-07T04:22:56.051254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-06T22:37:39.190020Z","title":"Star: A benchmark for sit- uated reasoning in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:39.190020Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:e95c6eb63a902dc116c1e9224353946ed50ffa6d632ea266deae7acd695bafe1","observation_id":"9fc06ce8-f3a8-4ffd-a395-9a0bd9cf8611","resolution":{"observed_at":"2026-08-06T22:37:39.190020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-06T15:53:53.840655Z","title":"Star: A benchmark for situated reason- ing in real-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14743","last_updated":"2025-08-28T16:45:48Z","snapshot_observed_at":"2026-08-06T15:46:43.525287Z","submitted_at":"2025-07-19T20:30:43Z","title":"InterAct-Video: Reasoning-Rich Video QA for Urban Traffic","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:53:53.840655Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2507.14743"},"observation_digest":"sha256:3505fbfe63deafc93e4e3d9c12a58ee0db2e6995157bdb731be0be7cb04ae0ef","observation_id":"fd965cf1-4793-44c8-9b71-6bfdcfe742e1","resolution":{"observed_at":"2026-08-06T15:53:53.840655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-04T13:22:35.455844Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.455844Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:01f7fce953f4fcdf2b78825d26739d99d53f83d07c2b461fd81a19ebe1ff978e","observation_id":"bccc7492-cf70-4dea-a402-134cf0aea9e6","resolution":{"observed_at":"2026-08-04T13:22:35.455844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-03T20:23:07.271934Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:07.271934Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:8f762446fcc627d6639ad27de46a4ff78a5582e06d1bef6c0dfc3d4219466647","observation_id":"905837be-2b9a-4bfc-bfc4-713a1d332ae9","resolution":{"observed_at":"2026-08-03T20:23:07.271934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2512.23292","last_updated":"2026-05-20T15:48:38Z","snapshot_observed_at":"2026-08-01T23:47:11.303976Z","submitted_at":"2025-12-29T08:26:27Z","title":"Agentic Physical AI toward a Domain-Specific Foundation Model for Nuclear Reactor Control","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:19.490074Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2512.23292"},"observation_digest":"sha256:1fa1e78e4b6bc5eb570ff18b909287fd1900717e8c8dcd386487f564394b2807","observation_id":"735132a7-13bc-4a9b-b53a-e64c0780247c","resolution":{"observed_at":"2026-05-21T17:00:24.028688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-03T11:13:16.935561Z","title":"Star: A benchmark for situated reason- ing in real-world videos.arXiv preprint arXiv:2405.09711,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-08T14:41:26.174719Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.935561Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:bc0af82278d170939157612122024da0ad32a63dca0370c8ee2a52cd2d7af8e5","observation_id":"120f12dd-3a86-4f5d-9f94-c11e9fbba5a2","resolution":{"observed_at":"2026-08-03T11:13:16.935561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:973ca7a3bf08455fb83daf42bc4cc83f20854b186e4bed9243de8f4958b14384","observation_id":"66a596ee-822f-4326-9cc1-e40f7e93a353","resolution":{"observed_at":"2026-05-14T22:08:04.316200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:f025d66427b6ae954127dbb1d3a9f71e5d71582f2920795ae5bfa50019f4c36e","observation_id":"cc5e434d-a353-4b6b-8158-55286c0d98ed","resolution":{"observed_at":"2026-05-10T23:15:50.112085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T12:03:09.408019Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:cdda9d682dc10376743bdbd9eeca66a168a6a70bbffb4742a8adb1ce9518f86c","observation_id":"123b9b79-0ab7-486c-a028-10ec04398d9d","resolution":{"observed_at":"2026-05-10T12:05:22.204503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T17:34:10.344111Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:b1446b0463884c583b8292d8d51f4a5bca260119dcef05a951c2b0f18ef79528","observation_id":"1ed24a58-b4f4-4690-898a-625f32d58e0e","resolution":{"observed_at":"2026-05-19T17:37:41.709145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.08452","last_updated":"2026-05-08T20:17:44Z","snapshot_observed_at":"2026-08-02T11:51:01.160947Z","submitted_at":"2026-05-08T20:17:44Z","title":"NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:23:04.253007Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.08452"},"observation_digest":"sha256:0c86a55cff1b30d1c6d2c396a3c60e1ba9e303ef02fbc3ea34c06652ea60b3b5","observation_id":"5aa56276-6bf3-47d2-9082-8289ec639140","resolution":{"observed_at":"2026-05-12T07:41:31.979277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.09874","last_updated":"2026-05-11T01:59:59Z","snapshot_observed_at":"2026-07-30T14:13:44.494421Z","submitted_at":"2026-05-11T01:59:59Z","title":"EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T04:37:46.090777Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.09874"},"observation_digest":"sha256:6faceb51167ca16ea076b02391ba737b937c6c9640e35beb290cc65e8728270a","observation_id":"fb947a5c-c059-4932-a558-f2947109e8d2","resolution":{"observed_at":"2026-05-12T06:06:24.536554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:21.487431Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:fbc058d0c31c844d0e944bcd0eafd5e3b87ddedc8514794d2b0568e369ca3f96","observation_id":"f67abafe-e20d-4377-87db-50dc8928964e","resolution":{"observed_at":"2026-05-12T06:31:26.645656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:42.726350Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:389db787db3e57c63c6114625bc89c3e649c8151872dbc8f83c1dafbaa3e7eb3","observation_id":"3da4fe23-a46b-445d-9362-f21ccd5487f8","resolution":{"observed_at":"2026-05-13T06:57:28.352513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-08T15:14:20.631028Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:5f045cb582c854a8004d15383e6e501905763ea964cf2acf466764f5f1135f0f","observation_id":"15ac86a5-8aaf-41b1-ad16-b6159506d969","resolution":{"observed_at":"2026-05-20T14:48:23.101517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.21931","last_updated":"2026-05-21T03:00:35Z","snapshot_observed_at":"2026-08-04T00:34:51.754881Z","submitted_at":"2026-05-21T03:00:35Z","title":"EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:30.508843Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.21931"},"observation_digest":"sha256:b3c005b3f8837d9d0e2472f1809c101b3fe8a2e77eae05219d1442f468f80de7","observation_id":"27867a6f-0e53-492e-93be-22038c983a16","resolution":{"observed_at":"2026-05-22T07:21:12.820432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-05T09:42:53.562841Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:1d16ff6856146d180bc5177ca791de369bbddd83bda9250bc0814eff038cec47","observation_id":"0e77163e-16be-4107-86bd-f14845461c73","resolution":{"observed_at":"2026-06-29T18:23:50.384160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.06338","last_updated":"2026-06-04T16:12:43Z","snapshot_observed_at":"2026-07-06T23:46:10.612537Z","submitted_at":"2026-06-04T16:12:43Z","title":"StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:05:47.810096Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.06338"},"observation_digest":"sha256:f1131d37999b50fdd184bd58c8d348c7c39e2244bf346a300536921ca03a93a7","observation_id":"f6646ba2-5194-4238-8731-f1f8dca3350d","resolution":{"observed_at":"2026-07-02T12:26:57.200530Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:63c0c84d353f3c791bdbd9f6ec4b90a98ddbd81c6a717a2f3aa4cba16017ddfb","observation_id":"a0677d9f-3162-40e3-93f3-a10432fe406a","resolution":{"observed_at":"2026-07-02T20:27:22.643440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.25585","last_updated":"2026-06-24T08:56:48Z","snapshot_observed_at":"2026-08-04T14:09:28.537223Z","submitted_at":"2026-06-24T08:56:48Z","title":"FeVOS: Foresight Expression Video Object Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T21:13:21.500674Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.25585"},"observation_digest":"sha256:31eddb0f536cd943a22a4414be9864960f98e249662c279ea7ba441dd3a8e333","observation_id":"c14895da-190b-4922-aee1-fe6cb16ea015","resolution":{"observed_at":"2026-07-04T19:30:08.033476Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27922","last_updated":"2026-06-30T06:57:21Z","snapshot_observed_at":"2026-08-02T14:50:41.162807Z","submitted_at":"2026-06-26T10:15:36Z","title":"Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T04:07:52.232959Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27922"},"observation_digest":"sha256:d560bc667f4223cf4211170bc3ff9cef82583cc462eaefccfed78b67f31d6042","observation_id":"ae2fc7de-4929-4e7f-91f1-86a672fb19dc","resolution":{"observed_at":"2026-07-01T17:15:50.640611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27922","last_updated":"2026-06-30T06:57:21Z","snapshot_observed_at":"2026-08-02T14:50:41.162807Z","submitted_at":"2026-06-26T10:15:36Z","title":"Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T09:53:49.542693Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27922"},"observation_digest":"sha256:a0946a84a108cba531d448fbc56ecad6833b35d51303f134c7f50e05118c0447","observation_id":"735146d8-3a12-4ed6-b5a0-2d2961f19a2f","resolution":{"observed_at":"2026-06-30T09:54:34.485078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27922","last_updated":"2026-06-30T06:57:21Z","snapshot_observed_at":"2026-08-02T14:50:41.162807Z","submitted_at":"2026-06-26T10:15:36Z","title":"Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T06:47:47.324684Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27922"},"observation_digest":"sha256:c3cb92f258420bd9b33e418e8c3a5979f5b596e928165a51718199b028fc2f43","observation_id":"80288e54-4781-49cd-ad48-7730585a28a2","resolution":{"observed_at":"2026-07-01T09:05:37.282597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27999","last_updated":"2026-06-29T10:15:53Z","snapshot_observed_at":"2026-08-06T16:35:46.841389Z","submitted_at":"2026-06-26T11:52:37Z","title":"HumanMoveVQA: Can Video MLLMs reason about human movement in videos?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T04:53:11.830488Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27999"},"observation_digest":"sha256:3c2bbf9a6fff59e87124b00fe9f16cb10a96bbee1d47f7fd5ca79ca28ec43637","observation_id":"13711394-58a0-4b2c-a88a-453d55d6f546","resolution":{"observed_at":"2026-06-29T19:13:53.048614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.27999","last_updated":"2026-06-29T10:15:53Z","snapshot_observed_at":"2026-08-06T16:35:46.841389Z","submitted_at":"2026-06-26T11:52:37Z","title":"HumanMoveVQA: Can Video MLLMs reason about human movement in videos?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:56.063333Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.27999"},"observation_digest":"sha256:c299304046426374fad4229d42db8be49b021503cd609182587d43caa6cfcdd3","observation_id":"0978f925-f5ae-4cf8-97a3-fee8566e1573","resolution":{"observed_at":"2026-06-30T09:54:35.318699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.29915","last_updated":"2026-06-29T07:51:25Z","snapshot_observed_at":"2026-08-04T10:56:20.672023Z","submitted_at":"2026-06-29T07:51:25Z","title":"H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T06:16:51.452335Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.29915"},"observation_digest":"sha256:01bbdb90ee89fe695ccb14ed567f1adac451ab861f3d9e4c3a0d1b533eabfaaa","observation_id":"a4642844-0455-4f73-8e94-04cae7b4956a","resolution":{"observed_at":"2026-06-30T06:24:19.569669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.30026","last_updated":"2026-06-29T09:27:02Z","snapshot_observed_at":"2026-08-05T16:53:44.108925Z","submitted_at":"2026-06-29T09:27:02Z","title":"MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T06:25:38.593423Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.30026"},"observation_digest":"sha256:fe488cb40f09b4cbc3b57fe906be28a8e16c0441177f6db708e760c03d0801c4","observation_id":"6bf62ec9-5422-40a6-9e7f-ff5da6e0f4dd","resolution":{"observed_at":"2026-06-30T06:34:19.497431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-01T22:45:07.891633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15641","last_updated":"2026-07-17T05:34:29Z","snapshot_observed_at":"2026-08-07T08:48:58.437566Z","submitted_at":"2026-07-17T05:34:29Z","title":"IMBench: A Benchmark for Intuitive Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:45:07.891633Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2607.15641"},"observation_digest":"sha256:af0e67383831c9e2c9f694d4164621c6f8a293c6900e2793a3a3d2c1a2aa5563","observation_id":"88dcadad-d535-4981-8826-bc546bb0920b","resolution":{"observed_at":"2026-08-01T22:45:07.891633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.09711/citation-record","integrity":"/paper/2405.09711/integrity","json":"/paper/2405.09711/citation-record.json","paper":"/paper/2405.09711"},"outbound":[],"paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2405.09711."}