{"as_of":"2026-08-14T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:252c8b8bc6642260767422bf5347af34e1c5af2bf2d87341347c69900ac6a2c0","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:05:52.524432Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:05:08.124096Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:26:14.022696Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"cited_work":{"arxiv_id":"2506.08817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08817","snapshot_observed_at":"2026-07-01T21:26:14.022696Z","title":"Video-cot: A comprehensive dataset for spatiotemporal understanding of videos based on chain-of- thought","venue":null,"work_id":"8d9acd65-4bc7-4f3b-805e-dfb46b9f4a1f","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2506.08817","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:776bcdaae04368fcc586c5bca02f22c859db853e5b0742ab632a951662966214","observation_id":"3c1f2cfd-c49a-4438-a077-9db5e8271014","resolution":{"observed_at":"2026-05-15T20:50:17.350435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"cited_work":{"arxiv_id":"2506.08817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08817","snapshot_observed_at":"2026-07-01T21:26:14.022696Z","title":"Video-cot: A comprehensive dataset for spatiotemporal understanding of videos based on chain-of- thought","venue":null,"work_id":"8d9acd65-4bc7-4f3b-805e-dfb46b9f4a1f","year":2025},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-14T01:58:02.382912Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2506.08817","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:a27171007b786f0497aee6a0bdbc66ee92ead97889d5f7e8033109ab9b101412","observation_id":"24ee94e1-8303-4108-aa2e-2f058298ad39","resolution":{"observed_at":"2026-07-01T21:26:14.024501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08817/citation-record","integrity":"/paper/2506.08817/integrity","json":"/paper/2506.08817/citation-record.json","paper":"/paper/2506.08817"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:05:48.635476Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.635476Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:85493c27a4cdba23b714100829c0849d2b3ead49c2d8c6e733f0691657c38ed5","observation_id":"5bb3a05f-3d51-4414-aa4a-eae77d525432","resolution":{"observed_at":"2026-08-07T05:05:48.635476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:48.718880Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.718880Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e3a82230b41aa3f375f3ea85eef469b0c70a266cdc5aee7ededb123a541b1959","observation_id":"0c20c3de-2ff6-4232-adf4-ecdb902442a0","resolution":{"observed_at":"2026-08-07T05:05:48.718880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:48.783213Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.783213Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:cbbbfc813f0185f58793545a7b60891999b927a912bacf8e7c7d7b7142d0bd2b","observation_id":"dc856c4e-d01d-4bd3-b423-99e84f180559","resolution":{"observed_at":"2026-08-07T05:05:48.783213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:05:48.907545Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.907545Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:be8c20515dad74b3083c2ee171d6dd84aa7f3f5ce01501a37a17e4d1102fcaae","observation_id":"ad00dba6-a2b0-420e-8401-97d03d124e81","resolution":{"observed_at":"2026-08-07T05:05:48.907545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T05:05:48.972426Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:48.972426Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:dbd1adb4a41c4a347f83cf0a69a60a3da2a010c1dc9caaa843b4c542a0b97263","observation_id":"2d51afe6-d7e0-45e8-9e31-499e2dac66c6","resolution":{"observed_at":"2026-08-07T05:05:48.972426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.587507Z","title":null,"venue":null,"work_id":"73845a41-685e-43a2-97de-6708057ecd45","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.032774Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0e9f7f2103ee01ca33bb019763b25e1da9b60386aa0d6605dfd0819b7868bbd3","observation_id":"e8f286c9-559b-43cd-9f87-03f5b28a30cc","resolution":{"observed_at":"2026-08-07T05:05:54.623729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.127473Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.127473Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:fe2a047e74cf2cc520d82737f3678f55facda80a9722dabb192a2063d88d9850","observation_id":"45845968-340f-41a2-83e0-240c62ece8e1","resolution":{"observed_at":"2026-08-07T05:05:49.127473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:05:49.226801Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.226801Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:87695ff60ef94a5167336419f522041ddcdf8ff8f03131cf4c599474a4b533e8","observation_id":"be30a964-10a9-4205-8fd0-0c8eb3993f5a","resolution":{"observed_at":"2026-08-07T05:05:49.226801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.455258Z","title":null,"venue":null,"work_id":"740d0de7-b864-4dc0-935f-95af0900eeb9","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.272926Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:c2f364aa2ffbdf217b9bb225be85f7f0e9b7bfe6e2e3702a7f719d504d337db8","observation_id":"34742e67-040f-4a7a-9e70-068b551af868","resolution":{"observed_at":"2026-08-07T05:05:54.503344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.377669Z","title":null,"venue":null,"work_id":"51d4875f-1079-43d2-9ff0-2501f593b25f","year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.337060Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0144e4b3d047e90fe5d04bea3ba235623ca20e16e84e4aa4b50615952b7a4676","observation_id":"7289eca3-1ae7-408e-9086-e68a09dd1326","resolution":{"observed_at":"2026-08-07T05:05:54.412188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.298085Z","title":null,"venue":null,"work_id":"f037ddf6-516a-45aa-a511-8a93d8bd46d1","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.405079Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e3a65c5ca57725c2bad3e62e1012b6f2ab5b5e127630be4fb65cceb6f87b23ea","observation_id":"8dc862f6-e5e3-43bd-821d-b8a7a9c1b479","resolution":{"observed_at":"2026-08-07T05:05:54.336836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.226395Z","title":null,"venue":null,"work_id":"787a6bff-657c-4388-98d1-e85d6f51ed4a","year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.482878Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e79fd7bbb26f484882b84d5fd9f7d44e46a5f3755e81b6eb1881788e5275b7bd","observation_id":"e6b18c16-faef-4a5a-b53b-8358cfceb7fa","resolution":{"observed_at":"2026-08-07T05:05:54.249080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.162515Z","title":null,"venue":null,"work_id":"b0af32ef-cf4c-4826-bd0c-27c814edcf77","year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.536320Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:7df420b6176b66276c2034e8f52db82346638d7ca45f4f3a82ab3c37c06a0ec5","observation_id":"c35d9176-81e6-4102-8e60-d4847392f46f","resolution":{"observed_at":"2026-08-07T05:05:54.197627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.556596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.556596Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:f274994c2fef92d8c5386e75aaf70fd4791b341f622a9077ef43dc1a88e29fec","observation_id":"f7ca53aa-bc24-46c9-91d9-710152be3999","resolution":{"observed_at":"2026-08-07T05:05:49.556596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-07T05:05:49.657151Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.657151Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:cce6a0ca17c7395046626a45ace9dbe3e216eacdee4f6440306e40ede7e65be9","observation_id":"a9fb629d-3629-47a8-91f8-94e5bb752c8c","resolution":{"observed_at":"2026-08-07T05:05:49.657151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.733931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.733931Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:8f6c3143db411b4e7daf47f801bad57b6282b1ed8986405c6b3065ba372a6acf","observation_id":"870a9dec-b907-4825-8931-9b5e0a04c1fe","resolution":{"observed_at":"2026-08-07T05:05:49.733931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:05:49.800282Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.800282Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:a0282bf31be74163ab2588706981024590afef1a606c1063c2372c8b10366d5f","observation_id":"37db3b06-e5cb-4610-a43d-2823f7bed0c4","resolution":{"observed_at":"2026-08-07T05:05:49.800282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:54.086502Z","title":null,"venue":null,"work_id":"e788977f-1c53-494a-8372-cacb614d7844","year":2014},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.844975Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:66c03c832915d1b9c9e11de8ab7862aa9cb29861631c781fd450cee8f827183c","observation_id":"6bfa53ee-8221-4807-8584-9be349890b09","resolution":{"observed_at":"2026-08-07T05:05:54.107770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T05:05:49.922593Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.922593Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4e5d16db015751477c040bc4fe6ca02d7451bc693f0592c965b7a06838424205","observation_id":"9244296b-2b9f-4ed3-876f-d9d4dd91443a","resolution":{"observed_at":"2026-08-07T05:05:49.922593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:49.998300Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:49.998300Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0bb4b27839a664d14ae728f545a0cb176c948a9e798cf777ca8dbc4603742567","observation_id":"a3a44d40-732c-40c1-bdc7-c74c8059104a","resolution":{"observed_at":"2026-08-07T05:05:49.998300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:50.106312Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.106312Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:a0a0978631d299490a9e5277d115a56c184b000872dd1c0c4bf39acba3a83c1f","observation_id":"d0f136bc-4194-4ab5-9013-016a1e8bf1f0","resolution":{"observed_at":"2026-08-07T05:05:50.106312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:05:50.302426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.302426Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:75224b3ad05a3d35553b5ac9718474811de69c53503853937eb52e42e2e53b8a","observation_id":"eb9729d3-c2fb-440f-8cb3-93a959fc0ed8","resolution":{"observed_at":"2026-08-07T05:05:50.302426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:05:50.381964Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.381964Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:508c1b662b19c9fe43063fe6fc71b224851eebb077d2b68fd4def12c26ef377c","observation_id":"85e6105e-b847-47d6-90f3-150fec9a4228","resolution":{"observed_at":"2026-08-07T05:05:50.381964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:50.434498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.434498Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:7b8902c3e021debede6e9856a8de1f6c558f757f338dcd553cc9eade9c6cd590","observation_id":"011268a2-bc2b-48f8-b15a-1da400af515b","resolution":{"observed_at":"2026-08-07T05:05:50.434498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.879032Z","title":null,"venue":null,"work_id":"246a320d-44b0-4e15-a2e9-d3e4f808c069","year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.524811Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:5f45a8a2836df5ac3445acebc95ae7163b9df786cfc9e0f32389534b5e2de705","observation_id":"ce02b562-e23d-4321-8962-9fb6545b3e90","resolution":{"observed_at":"2026-08-07T05:05:53.914958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.804896Z","title":null,"venue":null,"work_id":"73776ea7-3c04-4dbe-9211-158f8c8368e8","year":2019},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.570583Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:9c85e61ad5dc372f60b46db773be3ad54f89ba96251f5a9788cb0ef186749ae2","observation_id":"07fb5ba5-d66d-4b7f-9f0d-f28c1cc6b393","resolution":{"observed_at":"2026-08-07T05:05:53.838608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13132","last_updated":"2025-01-22T02:41:36Z","snapshot_observed_at":"2026-08-13T08:33:00.024549Z","submitted_at":"2025-01-22T02:41:36Z","title":"A Hierarchical Reinforcement Learning Framework for Multi-UAV Combat Using Leader-Follower Strategy","version":1},"cited_work":{"arxiv_id":"2501.13132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13132","snapshot_observed_at":"2026-08-07T05:05:52.854484Z","title":"A Hierarchical Reinforcement Learning Framework for Multi-UAV Combat Using Leader-Follower Strategy","venue":"cs.MA","work_id":"7d7b82e9-5957-421d-86a3-ec451aeadfe8","year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.617505Z"},"links":{"cited_paper":"/paper/2501.13132","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:5c87b7394253fa170df0e5f91562e40bb6c3cbab345aa26a50a2cab80e4f92f2","observation_id":"5f02ac96-0acf-40be-bbac-f1541978648b","resolution":{"observed_at":"2026-08-07T05:05:52.891078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.695858Z","title":null,"venue":null,"work_id":"e6ac124d-feb9-427b-af1a-a7240c5e68c5","year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.695041Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:42d1fdc9b4900dd2277f7ac2b844080926f938037597e366646b5ea09b275464","observation_id":"52826fff-791f-4ee0-b6e3-2dc7c6cc644e","resolution":{"observed_at":"2026-08-07T05:05:53.733960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.540905Z","title":null,"venue":null,"work_id":"ffa3f90b-6675-4faa-bb36-3309abcb0456","year":2020},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.749177Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:c1379ecc852a3c1ec74ccfc64e4b65a003233ff91c9c0fbc4f3a399644e395fd","observation_id":"545ae7e5-360c-463b-94b1-9b9bbdeb0933","resolution":{"observed_at":"2026-08-07T05:05:53.623654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-08-13T05:05:29.337860Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T05:05:50.794819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.794819Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:014e4ef5bfa17454f1320517e517e6da51eaa9d5dfd00e510c2e80d3fdccf4ed","observation_id":"9b435fac-ba84-4bce-a64c-509e62ab856b","resolution":{"observed_at":"2026-08-07T05:05:50.794819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.432260Z","title":null,"venue":null,"work_id":"cc093bd2-2f31-4035-bb62-c20b572f5db8","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.823238Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ad1a71d1af7c96cd4601a0c77ed332bc1f4b9bd46e3123544e91dc1933238812","observation_id":"f37a610c-9f3a-4389-ab15-0faeda8ee81e","resolution":{"observed_at":"2026-08-07T05:05:53.475500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T05:05:50.986480Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.986480Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:37d5fcff2e948f5faac5353a77ed9119d7d94df4da8676d13e3cd7d41747f72f","observation_id":"3b56d1d7-9785-4bd2-8a21-d6024728f220","resolution":{"observed_at":"2026-08-07T05:05:50.986480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-10T07:37:55.457401Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T05:05:51.040823Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.040823Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:c5a6eb2ed778d9f0eaf87681203dd6d70f054adc985c50c05905b11e68453d09","observation_id":"670e4871-610a-48f4-beaa-f688a8d2c2a2","resolution":{"observed_at":"2026-08-07T05:05:51.040823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00778","last_updated":"2025-03-02T08:04:44Z","snapshot_observed_at":"2026-08-07T17:36:17.192706Z","submitted_at":"2025-03-02T08:04:44Z","title":"AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00778","snapshot_observed_at":"2026-08-07T05:05:51.113645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.113645Z"},"links":{"cited_paper":"/paper/2503.00778","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0847f661c5a9def9ccc1c8315d3e0ee35afd2fdda10538f2d0eb6f08a5a03150","observation_id":"8268e98b-cb9a-496f-be14-873e0afb1ee1","resolution":{"observed_at":"2026-08-07T05:05:51.113645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.156506Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.156506Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e632b88268463479885ebb2e691ece7269c5f19231c633b0de744318996b9bdf","observation_id":"3c9ea9b9-9b8b-455f-9416-0a93b2cecd2f","resolution":{"observed_at":"2026-08-07T05:05:51.156506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:05:51.174239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.174239Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:5bd2e7894189797e40373428cfe3ac58e99ae6110c3b1613f71121c979b6c9c1","observation_id":"154ac2fd-1843-47dc-a81a-9cbd42e0e491","resolution":{"observed_at":"2026-08-07T05:05:51.174239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:05:51.222586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.222586Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:dcf00543a7e45da668cdecce2fdf784179707982c25bec5c0844dd749645d8e9","observation_id":"dfcfbc84-64a7-471a-b4e7-bcf3b59f2c27","resolution":{"observed_at":"2026-08-07T05:05:51.222586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-08-13T11:53:47.479250Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-07T05:05:51.278905Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.278905Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e8ff20c197ae214d522b6c4f4f7d8d100f5e362f5297b14ead680185593192ff","observation_id":"06d262f9-5160-4354-bb14-4ce73c8dbb54","resolution":{"observed_at":"2026-08-07T05:05:51.278905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T05:05:51.321299Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.321299Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:aeac922df6046b379c563ee5c128dac5f2ad72b9ee8ed7975815aa565eff5e6e","observation_id":"be460529-5b58-4610-be7f-b68b835bcbec","resolution":{"observed_at":"2026-08-07T05:05:51.321299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T05:05:51.389244Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.389244Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:4c52862b41fb90e5a7c807b2b8270458aeac94d047709527949e397dbfb4c78a","observation_id":"dc595d87-8263-4001-ad95-c20fdf1fbb47","resolution":{"observed_at":"2026-08-07T05:05:51.389244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.452700Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.452700Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ce086d695b16742bf868a7ac8291739a1eb5e5d8604685d659626881e97099f8","observation_id":"fad9e6b4-fe1e-405e-810d-9ec4116d083e","resolution":{"observed_at":"2026-08-07T05:05:51.452700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.531489Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.531489Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e107ddfa8a9acaca71f411d46b9f5cc17eae0c3c4747aa65952eb2cd53f0ee3e","observation_id":"7e64901f-1273-4103-ad89-2459ca0a4ad2","resolution":{"observed_at":"2026-08-07T05:05:51.531489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.727388Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.727388Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:1b24cc97f9ecc7275b07720e7b129923a9d645dd610ef696f8aa78d42f52d07f","observation_id":"383f9987-eab1-40c9-98ae-e2b977407e5d","resolution":{"observed_at":"2026-08-07T05:05:51.727388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.766666Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.766666Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:5426bd79e7477be403e60f17df3ef8fc0715f29de1ed0595fb5a7a25892d6b33","observation_id":"cca739ce-27b4-4b82-bfb1-b54fc1421926","resolution":{"observed_at":"2026-08-07T05:05:51.766666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.173849Z","title":null,"venue":null,"work_id":"a6531060-e399-4140-8a6c-39b127a297e9","year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.808790Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0a6defdb3653e1813ac0bbaaf483f008f3e75444c4376ba56b0090f85468620a","observation_id":"25eb0420-15b6-4e50-a4d0-e66fe251e329","resolution":{"observed_at":"2026-08-07T05:05:53.208143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-08-10T09:10:13.258194Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-07T05:05:51.881077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.881077Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:65f5f2382f987a1e51f014ab9ad225e5028c5cae33cabe805376e3090b992121","observation_id":"5edce4f5-8057-4003-b349-e0275c3d0714","resolution":{"observed_at":"2026-08-07T05:05:51.881077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:51.932240Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.932240Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:f363dcb7462025964d8ea6b0258f5b2e8aec168ad242dbd221ae4feb41538d1b","observation_id":"5c434370-7d88-4e53-9b1d-3bc0a6e97398","resolution":{"observed_at":"2026-08-07T05:05:51.932240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10906","last_updated":"2024-09-17T05:53:04Z","snapshot_observed_at":"2026-08-12T22:43:30.633562Z","submitted_at":"2024-09-17T05:53:04Z","title":"Multi-Floor Zero-Shot Object Navigation Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10906","snapshot_observed_at":"2026-08-07T05:05:52.050076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.050076Z"},"links":{"cited_paper":"/paper/2409.10906","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:e8f4071d2b75f9447740fded66f77bf2c355c2a6c493cd8f78a41af633d4159c","observation_id":"f74ad4db-bbe2-4757-bf7f-74ee999b15a5","resolution":{"observed_at":"2026-08-07T05:05:52.050076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-08T07:14:04.916356Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-07T05:05:52.150407Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.150407Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:9d3a018d7c23a5c746225db05162a6f21f3dfbe32a195e3e1b8e3797db8e67a0","observation_id":"3aa44a55-2906-47d5-8c55-b4bd0248f676","resolution":{"observed_at":"2026-08-07T05:05:52.150407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.089044Z","title":null,"venue":null,"work_id":"efb717b6-9d50-49b8-bd44-27b54c336c8d","year":2024},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.262230Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:c789040eff798002bbdfb9e03602e68a99f28a0759c4c7f681975fd640264e76","observation_id":"f030983c-b298-4f1d-aa5a-bf5106fa7115","resolution":{"observed_at":"2026-08-07T05:05:53.121846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13451","last_updated":"2026-05-09T11:40:06Z","snapshot_observed_at":"2026-08-02T06:35:33.765328Z","submitted_at":"2025-02-19T05:52:34Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13451","snapshot_observed_at":"2026-08-07T05:05:51.969310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.969310Z"},"links":{"cited_paper":"/paper/2502.13451","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:f459846efc735ce883e63f8c42434566ff76a8e228718f60b84059dd5469b9d8","observation_id":"c48b353d-8920-456e-bd51-8f4dbf33385e","resolution":{"observed_at":"2026-08-07T05:05:51.969310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:05:52.403000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.403000Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:134f8f3e19546ee069f56b527e167b0ba674a9c46c4b35f687c6696108ca5bc7","observation_id":"13dd506a-9ce8-4054-af5f-43844a6ab1c3","resolution":{"observed_at":"2026-08-07T05:05:52.403000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:52.452676Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.452676Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ab5698520c4cf641eee459ea80d74aa0c994588d30528b176a7deb1b3ca6ccb8","observation_id":"ba8c163e-b26f-4ddd-8163-f842de1875b1","resolution":{"observed_at":"2026-08-07T05:05:52.452676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T05:05:52.320226Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.320226Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:bf69741eb6d30205c3152466f342ec68b46584fe2e0e54209a1a29dd62ffd0f9","observation_id":"f7c99c30-876e-410f-a74d-9c6175633fc5","resolution":{"observed_at":"2026-08-07T05:05:52.320226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.970138Z","title":"InProceedings of the IEEE International Conference on Computer Vision","venue":null,"work_id":"7f333bce-13d9-4999-bc2b-91a8401e5a8b","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.187477Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:7eb598116dc30456d4ef66baaf80968b256baf1eb1c0df1aa0e2bae906281038","observation_id":"fd1f3ac7-99db-4b8d-8c00-7f2e08109049","resolution":{"observed_at":"2026-08-07T05:05:54.009897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:52.524432Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.524432Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:2854416fb5c4aef2e977990248255e3b41919e18fd2421c2365accf38584243a","observation_id":"03b014c6-c455-4380-aa62-984570a8de8e","resolution":{"observed_at":"2026-08-07T05:05:52.524432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.264157Z","title":"In European Conference on Computer Vision","venue":null,"work_id":"245efec9-14a6-4ae2-86d6-9339409cab08","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.609150Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0aaa2bcf46a916840e7ee7ede28a0a9ea0385a5cc67111f84d6e2b3e44861627","observation_id":"9bec9162-b2a2-4d5a-b069-e8adac345cfa","resolution":{"observed_at":"2026-08-07T05:05:53.292380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:05:53.353584Z","title":"InIEEE International Conference on Multimedia and Expo (ICME)","venue":null,"work_id":"3a43c2ce-e07b-49cb-8712-a9a03eb65952","year":null},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.898675Z"},"links":{"citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:ab978a3c831d80bfd71fa3b543516923c06810c98eac21d0eb3dd7fec977a4aa","observation_id":"50aa44b2-301c-4222-b0e4-d1aa835901ab","resolution":{"observed_at":"2026-08-07T05:05:53.399864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2506.08817."}