{"as_of":"2026-08-09T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c06ba57c6ef9889b06dde9078021c2402ce9a2e49905d78eb93eb628d8142184","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:35:47.027169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.249321Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:53cc74d918d13d5d2e6eaa62e5bd3f3692b4658062f02c2f8b21a265b5666657","observation_id":"dcaf2cd8-1f50-401c-83f5-de3f9366e583","resolution":{"observed_at":"2026-05-17T02:52:20.775068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-07T11:35:47.027169Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models.arXiv preprint arXiv:2410.03290, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.027169Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:4c38d5938350391dc7ba7beba5fec17ff688b95c82413e7929b4fbedf53d68a7","observation_id":"921a662e-7183-44a5-b656-983f70e2ff53","resolution":{"observed_at":"2026-08-07T11:35:47.027169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T23:34:53.529692Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.529692Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d1b265931a300d81ec3c45ba5716f53de84c8bbc03cde326c76ba946ea1c11e5","observation_id":"67ca3aea-21d9-42f0-82e8-0d874e7f886f","resolution":{"observed_at":"2026-08-06T23:34:53.529692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T23:29:24.133365Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-08T12:15:56.187844Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:29:24.133365Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:9fe675d0b0c104c115475095fca67be37111106e0a3ce2cba62da17501b675e7","observation_id":"874431d9-8e44-4c9c-b80f-5fc8a6dcd538","resolution":{"observed_at":"2026-08-06T23:29:24.133365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T22:37:38.924039Z","title":"Grounded-videollm: Sharpening fine- grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:38.924039Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:bfda8163180610962df7dea4d729496a2799b03e877df60bdcdf435b1e7ba899","observation_id":"255843c6-4a7e-4c5c-892f-b71afcacd37b","resolution":{"observed_at":"2026-08-06T22:37:38.924039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T14:44:28.022951Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.022951Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:d008413ee490a9b1d0d10df264017aa18163a501d2bcaa775dfd8a6410788894","observation_id":"e660d4f9-82e0-4d07-941d-532b62ab2a88","resolution":{"observed_at":"2026-08-06T14:44:28.022951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T05:30:36.525254Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.525254Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:f21f271bd4905e61cf68647bccdb0ed0070f8b45455c78544fef22b484ebbb86","observation_id":"cb8d8afd-6d9a-4832-a6ef-ffdc5fd7d998","resolution":{"observed_at":"2026-08-06T05:30:36.525254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T05:15:43.184734Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:43.184734Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:53989b86157c9853378d278defd2700e0c8168098dadd46c7bae508c32a71434","observation_id":"cccf61d6-12aa-4df8-8839-8fd1fec4e665","resolution":{"observed_at":"2026-08-06T05:15:43.184734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T05:12:38.429768Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.429768Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:c209bcefcf59754259307024cbc3719d6bfefa51e1ebd11805a81b2eb9737e3c","observation_id":"13f125b0-b270-4d4e-b194-a727aecc27fb","resolution":{"observed_at":"2026-08-06T05:12:38.429768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-05T23:32:17.609232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.609232Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:ec7fcf6266c77a291413fcd93c1c0974bc10dec5904a10e1dbe5c64205c374aa","observation_id":"5ee27c7d-fb51-4241-8eaf-ef831dfba3f3","resolution":{"observed_at":"2026-08-05T23:32:17.609232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-05T17:50:49.044330Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15641","last_updated":"2025-08-21T15:12:14Z","snapshot_observed_at":"2026-08-08T07:13:56.504049Z","submitted_at":"2025-08-21T15:12:14Z","title":"When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:49.044330Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.15641"},"observation_digest":"sha256:245e4bd66b7c40d242ab084271d3b7a3b3155053cf09d639261090682b2610f3","observation_id":"a9a7e9ff-10cd-4e27-b89f-d12e6896098a","resolution":{"observed_at":"2026-08-05T17:50:49.044330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-05T10:58:17.747639Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-07T14:11:47.550063Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:17.747639Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:375429927acad786c41def9d9bf3c37be10d45fc7efea877645a65d0e31329ab","observation_id":"41ca1c2b-a3bf-4f21-bef5-9b4434fbc12a","resolution":{"observed_at":"2026-08-05T10:58:17.747639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:8a8c785f2f10abe12a7ba717f4f0a4502d1b6db482c23ce63fceef18db5f23a4","observation_id":"551d36da-da25-4119-847e-9767d9931db7","resolution":{"observed_at":"2026-05-17T02:11:26.607886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2512.06673","last_updated":"2026-05-09T07:46:05Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T06:11:15Z","title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T00:54:53.789523Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2512.06673"},"observation_digest":"sha256:f01b6d4b6b2861e1ef6b3544eff61c6a81ec90b8cfaa0772b9bf4ae1aec05361","observation_id":"19a5d37e-6486-4a8a-b153-7e6e0d905da5","resolution":{"observed_at":"2026-05-17T00:58:46.609124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:6f4db9ccca05d239d437c3d85d9df2c711213eca7e750ebe94e0d11b49208bb6","observation_id":"70b78f38-3efd-4918-83b6-718938457278","resolution":{"observed_at":"2026-05-16T08:40:46.375077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-03T05:14:23.944562Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models.arXiv preprint arXiv:2410.03290, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:23.944562Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:818e1d4859ec6a646f7f43dd8525701707374332b69c10cf6c19c338e3cbf704","observation_id":"d164cb4b-ad36-47f8-b0d4-75525aeb73c1","resolution":{"observed_at":"2026-08-03T05:14:23.944562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-13T12:44:39.273341Z","title":"arXiv preprint arXiv:2410.03290 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03630","last_updated":"2026-04-04T08:00:26Z","snapshot_observed_at":"2026-07-13T12:44:38.978178Z","submitted_at":"2026-04-04T08:00:26Z","title":"A Multimodal Foundation Model of Spatial Transcriptomics and Histology for Biological Discovery and Clinical Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T12:44:39.273341Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2604.03630"},"observation_digest":"sha256:ad5686b71d59bee0f477367d9be0783c34deaf689ea7e726433b2ca1307ca5d4","observation_id":"a410e7bc-9a09-4f8b-8f2a-e680c85963b4","resolution":{"observed_at":"2026-07-13T12:44:39.273341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2604.03631","last_updated":"2026-04-04T08:01:02Z","snapshot_observed_at":"2026-07-06T22:52:48.277339Z","submitted_at":"2026-04-04T08:01:02Z","title":"Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T17:32:06.256142Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2604.03631"},"observation_digest":"sha256:c2af8087325f754059f509e123531b6adcf3df719f8258990e26c6540151a61d","observation_id":"d668af7f-8286-4138-881e-afcc6626edbf","resolution":{"observed_at":"2026-05-13T17:33:02.311291Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2604.08966","last_updated":"2026-04-10T05:10:15Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T05:10:15Z","title":"How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:48.559703Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2604.08966"},"observation_digest":"sha256:078abbc79e77ae224958e5b9c4410b4f26bfc52cc442ded8aae2eb9f997d6ddb","observation_id":"241d4e5e-d9e2-4581-9e32-7c01ee248be4","resolution":{"observed_at":"2026-05-11T08:05:58.925033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:c3a9396d52752d544e8cf2c3f7ccdeb4f297bfc2f478a42f588d31a68fc5f1ee","observation_id":"6dcc5857-4426-4d94-8fc3-e128035b778b","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-02T10:58:24.692632Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:7a80cf52ff7b0cb1ee5aca10ba0ef7d6da35aadb5b6beacb88f9e70ab7ab6c2f","observation_id":"da6f3052-00a2-46b6-8175-55d420989eb9","resolution":{"observed_at":"2026-05-14T19:32:52.391468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2605.14733","last_updated":"2026-05-14T11:56:14Z","snapshot_observed_at":"2026-08-06T01:04:24.065010Z","submitted_at":"2026-05-14T11:56:14Z","title":"Video-Zero: Self-Evolution Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T21:32:16.939563Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2605.14733"},"observation_digest":"sha256:5c1b4c953deafdb106e28f2c0fa393f29a4a51916672711f93d7076a9428e582","observation_id":"ed7acdf5-df22-44a5-a1a3-a99d5d8beb02","resolution":{"observed_at":"2026-06-30T21:35:04.426284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2605.21954","last_updated":"2026-05-21T03:40:22Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T03:40:22Z","title":"MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:13:43.716510Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2605.21954"},"observation_digest":"sha256:f00f8199fc287c94f2533c6fd6d737c947766f67b23e1bfebde125dcb8ebd3cb","observation_id":"8751f1f0-6f57-4225-ae09-27e7d4237a56","resolution":{"observed_at":"2026-05-22T07:14:42.418973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:f947c23643180622de7062b8fb9499623ac25a11e0203f6280c314f49f7a8c18","observation_id":"e8e66c53-1aa6-462f-8eae-33e353ef4e39","resolution":{"observed_at":"2026-06-29T22:13:59.520753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2605.28229","last_updated":"2026-05-27T09:43:06Z","snapshot_observed_at":"2026-08-05T02:10:57.115222Z","submitted_at":"2026-05-27T09:43:06Z","title":"VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T13:01:42.880738Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2605.28229"},"observation_digest":"sha256:cca8b538566f1e3f863706ff0b35686bc561185d99880c61dd0a4ccdcb79e640","observation_id":"ce3a092a-a93a-41bb-9264-0ca58af703fa","resolution":{"observed_at":"2026-06-29T13:03:25.917929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:ba17d8e9fd9d08d7b1e50015d2fbaaab7b60cb2998ddc23f859572ff10ba94bb","observation_id":"43060d12-bce0-4242-89ee-08bd37db8ef6","resolution":{"observed_at":"2026-07-02T17:27:14.973292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2606.09181","last_updated":"2026-06-08T08:20:42Z","snapshot_observed_at":"2026-07-06T23:48:35.190418Z","submitted_at":"2026-06-08T08:20:42Z","title":"Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T16:55:35.743040Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2606.09181"},"observation_digest":"sha256:07630004754c5d618ca255a19487fe96f78c28d2e61db8417f404eba2f9eb234","observation_id":"2f75dce3-b997-4a91-ab51-f7d37bfec2e4","resolution":{"observed_at":"2026-07-03T00:57:30.201488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:a0d086cf5a5594616156e72695c2b1d891a61c6334aab2e4cc30b9c755f2bfdc","observation_id":"b68500d7-1bc9-4b0c-be33-e5e2f117903b","resolution":{"observed_at":"2026-07-03T10:48:03.119304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2606.17279","last_updated":"2026-06-15T20:40:45Z","snapshot_observed_at":"2026-08-06T02:55:29.523710Z","submitted_at":"2026-06-15T20:40:45Z","title":"Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T03:40:26.565029Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2606.17279"},"observation_digest":"sha256:999de84605d881bc806be5c50077f641811e863dc7529b7c8c51ca22f28207a5","observation_id":"56cffcb1-b355-4a21-8d17-f5d2b404f5d5","resolution":{"observed_at":"2026-07-03T17:48:46.270090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2606.19706","last_updated":"2026-06-18T02:05:14Z","snapshot_observed_at":"2026-07-06T23:54:56.685241Z","submitted_at":"2026-06-18T02:05:14Z","title":"NEST: Narrative Event Structures in Time for Long Video Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T17:57:55.366051Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2606.19706"},"observation_digest":"sha256:df18f6679b5c1a515fad7d8016f167ac90367402f7442f7c09d08611cb825bc2","observation_id":"f266c6e2-8f7f-4787-a57c-2c67421b3810","resolution":{"observed_at":"2026-07-04T03:29:31.221922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.03290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-04T15:09:55.249321Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":"6cda7c97-9a94-4872-b214-cddce67fea61","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:3ca514d65cedfb67a347c95fad0c176889e61266a2844fa0d675a9fc447bf3c7","observation_id":"069fe2d3-7ff4-4e73-b830-14eee3dafe06","resolution":{"observed_at":"2026-07-04T15:09:55.251092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-11T08:59:46.244502Z","title":"arXiv preprint arXiv:2410.03290 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05089","last_updated":"2026-07-06T13:50:15Z","snapshot_observed_at":"2026-07-11T08:59:45.751461Z","submitted_at":"2026-07-06T13:50:15Z","title":"TimeThink: Reasoning with Time for Video LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T08:59:46.244502Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2607.05089"},"observation_digest":"sha256:bc29c5e024257181f0fb720b7909e60a5d9553c6488b14f49c4e2f51d2e4df07","observation_id":"dca9bb31-a4d2-417c-8449-830109fe3267","resolution":{"observed_at":"2026-07-11T08:59:46.244502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-02T00:44:50.709854Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-06T19:13:04.526298Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:50.709854Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:dc7c8bbf25e28620b50a7caf97ee88e24ceecc5a8f3912c3bed01f45bc8113a2","observation_id":"76950a0e-92bb-46e7-a5cc-8355dec280c7","resolution":{"observed_at":"2026-08-02T00:44:50.709854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-01T18:04:16.246667Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.246667Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fce03d01e208ec261a5f96cc00049b89e85801e520dd363bc96d6c26d1f66e74","observation_id":"2c1b856a-8498-4fe4-aeb1-ca770c12920d","resolution":{"observed_at":"2026-08-01T18:04:16.246667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-07-31T23:32:53.699768Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models.arXiv preprint arXiv:2410.03290, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-07-31T23:32:36.040113Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:53.699768Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:b2b10a7e7bd5d3b3dcc7494cd145275da0bfddaed0feff6a0d2f3cab8d79313c","observation_id":"cc0bda32-8dbd-402d-9fe7-50afc2fb0e4b","resolution":{"observed_at":"2026-07-31T23:32:53.699768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.03290/citation-record","integrity":"/paper/2410.03290/integrity","json":"/paper/2410.03290/citation-record.json","paper":"/paper/2410.03290"},"outbound":[],"paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2410.03290."}