{"as_of":"2026-08-17T03:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9aa354134b1762d06ea9067ce770d69257315724133b81263649fc13cb3445a3","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:27:47.145067Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02807/citation-record","integrity":"/paper/2509.02807/integrity","json":"/paper/2509.02807/citation-record.json","paper":"/paper/2509.02807"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T11:27:47.077290Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.077290Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:6373d143dae3ce7e11d1fc69688e2e46eefd0a55f156e8ae7b2e30994478f13f","observation_id":"4018e7bd-4846-4503-be68-928453b8ea2f","resolution":{"observed_at":"2026-08-05T11:27:47.077290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05930","last_updated":"2024-09-17T02:10:16Z","snapshot_observed_at":"2026-08-16T15:40:57.974475Z","submitted_at":"2023-04-12T15:50:19Z","title":"MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer","version":3},"cited_work":{"arxiv_id":"2304.05930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.05930","snapshot_observed_at":"2026-08-05T11:27:47.515908Z","title":"MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer","venue":"cs.CV","work_id":"18525668-89b5-4c48-9ed4-d1769a375b52","year":2023},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.082104Z"},"links":{"cited_paper":"/paper/2304.05930","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:bd4ad60120ede462272a4c13fe6dc79ec6ded6a57982d4608364ae466e047690","observation_id":"2c9655e2-ebaa-4cb8-84bb-095876763e1c","resolution":{"observed_at":"2026-08-05T11:27:47.523163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:27:47.597466Z","title":"Visual instruction tuning","venue":null,"work_id":"3f9b0391-32bb-4169-8a9a-b24ecf9f50b7","year":2023},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.092352Z"},"links":{"citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:02c98dcf962c4197cfaa1bcabbe4fda4acba8292800265ae3541b77623b87982","observation_id":"004ce299-6190-41c0-9871-e2cded83df37","resolution":{"observed_at":"2026-08-05T11:27:47.602290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T11:27:47.097393Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.097393Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:ed7c32a3314a8382ec205daa74a353a90cc522ecfd755194816a51c0baa03b53","observation_id":"eba6ded5-0332-4278-a22e-9cfa58f8dd31","resolution":{"observed_at":"2026-08-05T11:27:47.097393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T11:27:47.106806Z","title":"The 2017 davis challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.106806Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:b8448e7e10ff8b6574dfa19044e7fdcafeed854234a5088714412f5c9d952fac","observation_id":"cbaa8710-72bb-4e3c-b023-83dabb5b3358","resolution":{"observed_at":"2026-08-05T11:27:47.106806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T11:27:47.111735Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.111735Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:0d46e062768eb97bbc0927960219f4c1aa7fea6afe767a98a5f9f119747c61e3","observation_id":"b6705038-e826-46a5-93ff-615f14bea5d4","resolution":{"observed_at":"2026-08-05T11:27:47.111735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:27:47.126396Z","title":"Seeing the arrow of time in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.126396Z"},"links":{"citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:5e6e37e8a5e0866b7cf829d8d9a4970fbd0db091e02f88549e5db3831a6abc71","observation_id":"85c6c5a5-706f-4501-b376-a90ea40fade8","resolution":{"observed_at":"2026-08-05T11:27:47.126396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-08-16T14:50:08.427255Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-05T11:27:47.135264Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.135264Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:0fea439cf40c3ab4959b5e091067cdfe54f95519321d59340c1d840cdb1fbeaa","observation_id":"06762684-0978-4228-8d19-64855a174207","resolution":{"observed_at":"2026-08-05T11:27:47.135264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-16T11:21:33.397874Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T11:27:47.140036Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.140036Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:3d8a87bf23319ae10d36c788658ffeccc615730c44ada8fcf6620d1e773dc28d","observation_id":"48401b11-edf3-420b-9e40-32acd7052281","resolution":{"observed_at":"2026-08-05T11:27:47.140036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-15T17:40:10.309874Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-05T11:27:47.145067Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.145067Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:2c99ae8afd173eecd4d15a8c29c8010131d411db4d895762bf750d4f6a91bc14","observation_id":"4ebc1d82-7cb1-49f5-9264-9aaf78b8426d","resolution":{"observed_at":"2026-08-05T11:27:47.145067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-05T11:27:47.130766Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.130766Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:6745e5aa4ee80d43071fb5f287d4ba25fc21973b077af8f67912986f42add963","observation_id":"6e33aa3b-2862-416a-ab2a-c549c15742d1","resolution":{"observed_at":"2026-08-05T11:27:47.130766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T11:27:47.086884Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.086884Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:e2c254ed61e94009cb047067a28bbe2d7d76e61654b5bb18ec449dd5feeaa83e","observation_id":"95e3f717-51cf-4246-8c63-32409f313d6f","resolution":{"observed_at":"2026-08-05T11:27:47.086884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:27:47.117264Z","title":"Pixfoundation: Are we heading in the right direction with pixel-level vision foundation models? arXiv preprint arXiv:2502.04192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.117264Z"},"links":{"citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:0c2398da873ec2d9722ff565205e16977d394c7112209af048104ed2287a40ce","observation_id":"517b939d-d764-4c18-9746-ecb1f30d78b0","resolution":{"observed_at":"2026-08-05T11:27:47.117264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04923","last_updated":"2025-03-25T10:08:13Z","snapshot_observed_at":"2026-08-17T02:29:56.625545Z","submitted_at":"2024-11-07T17:59:27Z","title":"VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04923","snapshot_observed_at":"2026-08-05T11:27:47.102050Z","title":"Videoglamm: A large multimodal model for pixel-level visual grounding in videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.102050Z"},"links":{"cited_paper":"/paper/2411.04923","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:fa870b8fc8cfc6ed1ee05c73f881bfcc57c5edb8d15711d451844618b6819a38","observation_id":"f13312fa-4a4e-4185-93fd-866c791bac9f","resolution":{"observed_at":"2026-08-05T11:27:47.102050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T11:27:47.072265Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.072265Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:bfeedf83d539f55989a5a6b162b04f1b67cea56e1d68f75aad7bae7f0301f857","observation_id":"bc7b336e-7c28-4247-84c1-c97ccebf12f9","resolution":{"observed_at":"2026-08-05T11:27:47.072265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T11:27:47.067394Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.067394Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:f7cf84a9d01196c25b85a0a8d476eadc76a9c184a7f024d3ac31c3b60ffde077","observation_id":"21ce8e8d-0df4-4b25-bdb4-0b5dcea8cd19","resolution":{"observed_at":"2026-08-05T11:27:47.067394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T11:27:47.062248Z","title":"Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.062248Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:7f33d514e37d94417960690aca1613ab193df6addb681947ed6ccd067bb5a4ab","observation_id":"0f7d0fa9-84e4-4575-b4cc-093f85176bcc","resolution":{"observed_at":"2026-08-05T11:27:47.062248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T11:27:47.121911Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.121911Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:b6e7841b3e757712f48766d10b50fdbe609c9f30306dbfb46504f7068ffce0ea","observation_id":"6bafd136-ad1a-413c-96a7-1c0255ab1620","resolution":{"observed_at":"2026-08-05T11:27:47.121911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:00:23.266808Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2509.02807."}