{"as_of":"2026-08-15T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4a51c6506af75ebdd6ce718d17783b35a0721e938b0f95262f592e9c8b9b0d3","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:55.846636Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:39:43.071937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T08:40:46.400243Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-08-11T18:39:43.071937Z","title":"Distime: Distribution- based time representation for video large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.07689","last_updated":"2025-08-07T06:38:32Z","snapshot_observed_at":"2026-08-12T14:25:34.420721Z","submitted_at":"2024-12-10T17:27:32Z","title":"RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T18:39:43.071937Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2412.07689"},"observation_digest":"sha256:67b45d914790ae905c428d6b9d2211db4d47c11a8be894d7548c96dd1cef4849","observation_id":"ec3e9b74-62dc-400b-add3-28e3b82cbe76","resolution":{"observed_at":"2026-08-11T18:39:43.071937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.24329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distime: Distribution-based time represen- tation for video large language models.arXiv preprint arXiv:2505.24329","venue":null,"work_id":"2bc81c15-b727-4980-ba39-352a81587c13","year":2025},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-14T12:19:00.856841Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:72969b3b10c0fde4febee91a9cb04f9efaa9900169d502e07fadbc2f38512bdb","observation_id":"48cf3857-f29c-42f7-8e63-d7dbd67fd0c2","resolution":{"observed_at":"2026-05-16T08:40:46.401909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-08-03T05:14:24.814323Z","title":"Distime: Distribution-based time represen- tation for video large language models.arXiv preprint arXiv:2505.24329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-14T12:19:00.856841Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:24.814323Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:ae5f11bb0a2e3e2bf47637b90289913b5a05edc6778e1ffcd5579dcdf3f7b0c7","observation_id":"4944cbca-33ab-44b1-a708-1985c1e860aa","resolution":{"observed_at":"2026-08-03T05:14:24.814323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.24329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distime: Distribution-based time represen- tation for video large language models.arXiv preprint arXiv:2505.24329","venue":null,"work_id":"2bc81c15-b727-4980-ba39-352a81587c13","year":2025},"citing_paper":{"arxiv_id":"2604.25276","last_updated":"2026-04-28T06:34:19Z","snapshot_observed_at":"2026-08-15T08:04:13.043348Z","submitted_at":"2026-04-28T06:34:19Z","title":"OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T16:51:43.783133Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2604.25276"},"observation_digest":"sha256:97fb38bdcd6d6ac1f64a794419bde71b7829d7037494b2e697403ff3193045c6","observation_id":"1f28223d-7405-4cd7-83c5-6a4824473fa1","resolution":{"observed_at":"2026-05-11T23:31:15.758838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-07-31T23:32:54.788326Z","title":"Distime: Distribution-based time representation for video large language models.arXiv preprint arXiv:2505.24329, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-08-14T08:41:58.807029Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:54.788326Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:7c1669b96e521d0c4e1b024362d5e4022b1356a7971c84bdf13dff57b96d12b3","observation_id":"fb0229f2-85fa-4610-ba82-d25d5f94f700","resolution":{"observed_at":"2026-07-31T23:32:54.788326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24329/citation-record","integrity":"/paper/2505.24329/integrity","json":"/paper/2505.24329/citation-record.json","paper":"/paper/2505.24329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:32:49.930599Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:49.930599Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5f59f130e1001287be3a13d93c65b223c5dc392fa78cadfa6137fdb86e45facb","observation_id":"e983d84c-ad2e-4741-9dd1-b6b1a56c401b","resolution":{"observed_at":"2026-08-07T12:32:49.930599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:50.034969Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.034969Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:67d06b2cda842476d269fa56489d528d6fe22017dedb704f62ba51c2f895d8dd","observation_id":"046fa311-fe12-4a19-b887-0a6fd01b6ce5","resolution":{"observed_at":"2026-08-07T12:32:50.034969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-15T02:47:56.537509Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-07T12:32:50.149539Z","title":"Cg- bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.149539Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:3af0222aceb35a424952059a0a41daf61553d6788765fccc093abc79c89c751a","observation_id":"e150a606-02fb-4a4e-8b6f-c23c42111155","resolution":{"observed_at":"2026-08-07T12:32:50.149539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-15T07:53:20.502730Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-07T12:32:50.318296Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localiza- tion ability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.318296Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:89a93ed3a969b6f5c9b89e44332fca3f71ab7539463335f8f7ecaecb29773bf4","observation_id":"866881c4-15df-4a8a-b47b-10bf6d8e8030","resolution":{"observed_at":"2026-08-07T12:32:50.318296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:32:50.466205Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.466205Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:206bd85ec048f4d8211db780638c5ca5c14050983e9374f2746ae7ab3eb2e7fd","observation_id":"538b5115-2b18-4501-8090-17fa6c5d4c27","resolution":{"observed_at":"2026-08-07T12:32:50.466205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:50.609800Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.609800Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:f1f611d153b49d43bbef1e066d7d5dc00b19a7ac82c79584a042a6a231b2577e","observation_id":"5f47d592-0777-426d-a89d-ac41ca6148e3","resolution":{"observed_at":"2026-08-07T12:32:50.609800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.666719Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"36c96749-2fdf-45ee-af60-9117a63cf94b","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.706528Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:43fc259a37727c1eb41893d4aed2bcbbdfe45f3a384151ce5117e0d071d78db2","observation_id":"af726b0c-8c59-43c4-b747-5ff92d29d4e0","resolution":{"observed_at":"2026-08-07T12:33:00.717368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:32:50.808047Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.808047Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:459ecd1a5fea80c4d4ab56216537baedfa46ac38c940f4a8e482cab55e1b16b0","observation_id":"7fee8cdc-d608-4d80-879c-706639178c51","resolution":{"observed_at":"2026-08-07T12:32:50.808047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.554359Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"9da7f3cf-0813-422f-b422-f27983d264a9","year":2017},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.911068Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:1d2837f486437aa0bc14af062e9474a088bad2a8bdcb94e3c71d08f383ed0a62","observation_id":"872d5253-b461-4aaa-a439-6770b4e4f72a","resolution":{"observed_at":"2026-08-07T12:33:00.601125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-15T04:41:05.466328Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05185","snapshot_observed_at":"2026-08-07T12:32:51.011685Z","title":"Linvt: Empower your image- level large language model to understand videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.011685Z"},"links":{"cited_paper":"/paper/2412.05185","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5dc26be1b349f46a05c4a2c6c8aba15ca122c86dee81c690f44cb28db4207395","observation_id":"e2bdee07-8166-41f5-a9a7-78f04a2aaf8d","resolution":{"observed_at":"2026-08-07T12:32:51.011685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:51.110427Z","title":"Saliency-guided detr for mo- ment retrieval and highlight detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.110427Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:100599ac95e5ac512dea69985293890290b93eb55f3eaf639d2c0f68bfb07a61","observation_id":"8d62473d-8e26-4913-b3c3-cf1625e38c8f","resolution":{"observed_at":"2026-08-07T12:32:51.110427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.433548Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"ef92e4d3-f17d-497a-837b-1f28001e0ae1","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.175073Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:8d618b6808f630715b6a0ecdb55b166d34172e56d9f158fa6b55cb4c1d3bcdd6","observation_id":"a097448b-0aec-4dac-9ec7-7ab4de3fd9dd","resolution":{"observed_at":"2026-08-07T12:33:00.485258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-08-14T13:26:34.246913Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-07T12:32:51.273965Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.273965Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:8375bee1c2da5ba334909d01bac73e851578c62a75278b9c5ae56b14804aab08","observation_id":"4a7dd681-5851-4269-98a3-7d8710374cc3","resolution":{"observed_at":"2026-08-07T12:32:51.273965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.297685Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"9b87e8bc-0f5e-43f6-bd6e-bdffb48f4574","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.368935Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:97495e79da052a22709e8569b2acd443f9699be15313485bfe40b537b04ab283","observation_id":"46d40a68-0663-4594-a67f-c871ece1aa77","resolution":{"observed_at":"2026-08-07T12:33:00.364833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.163107Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"4c993c18-535e-4b89-9065-10491df68a77","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.473579Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:66ec423bd307de1f07c84ea3abd097f1f8cbe55535a34f4a799f0702d9ba23e3","observation_id":"ad03b8fa-587b-4f00-b849-d94343e2cd88","resolution":{"observed_at":"2026-08-07T12:33:00.224325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:51.534075Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.534075Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5f2ae6615332f1f27b297f73b8769de648bd2eb5b7bb62be484444af128f5c56","observation_id":"99209f1d-808b-46a7-b8ad-cc1eda223349","resolution":{"observed_at":"2026-08-07T12:32:51.534075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.971907Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"be680b12-536f-40ee-ae7c-7cf6a3a4fccd","year":2021},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.628353Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:41339f29394f3947977197b9e167dfe99b8e8528f84b15399379cc9cea7452d4","observation_id":"e0516f95-5d10-48ae-b0aa-9690bfc48e09","resolution":{"observed_at":"2026-08-07T12:33:00.059185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:32:51.722537Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.722537Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:db179ec1d53756dc1ffd43ec74cdb9b31a2737f7d4b2b4261d0dc02d1b04482e","observation_id":"ca54fab8-e018-4a59-a862-6e7ff182cc8e","resolution":{"observed_at":"2026-08-07T12:32:51.722537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.808388Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"23120e34-8387-477e-8f79-c87f49999980","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.820610Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:a2d6e3238214c103c08bcd643da44b0bbd3c1c4369db95df64fa383e4275d1a9","observation_id":"c6a31558-7800-4065-9018-751a255c5cb3","resolution":{"observed_at":"2026-08-07T12:32:59.896873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T12:32:51.944782Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.944782Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:4283a82c044f919e832700ab30ba02f0811b9575eb065e05a0df6f05715ac6f8","observation_id":"21d7e694-12db-4d82-a923-8fecfdde71d9","resolution":{"observed_at":"2026-08-07T12:32:51.944782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.666377Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"6d839551-7bdf-44e1-98dc-504885d4a7b6","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.015588Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2aea14344b96a8adb76672b39593e99402369d2d558044dfcb207b3493a6497a","observation_id":"6db8b069-5dc4-4c7b-b4e0-4830daab98cf","resolution":{"observed_at":"2026-08-07T12:32:59.732986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.485707Z","title":"Generalized focal loss: Learning qualified and distributed bounding boxes for dense 9 object detection","venue":null,"work_id":"97b1661b-c505-4b70-9270-594e3acc1621","year":2020},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.100242Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:3b767c0a50d8087acb5bafed056de8c989939e36c0470eb46477d0f2329d7ac5","observation_id":"1c5b0dde-dbb6-429c-8e15-e36514292473","resolution":{"observed_at":"2026-08-07T12:32:59.550281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:52.213019Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.213019Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:00b7591c61400344dbae283bc5d30ee6d5781e07cb121bff763fd8135a814d2b","observation_id":"236837cc-17ff-4c9b-845d-37a95944f148","resolution":{"observed_at":"2026-08-07T12:32:52.213019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-08-13T04:44:24.786629Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-07T12:32:52.287195Z","title":"Groundinggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.287195Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:27f6e9602f515c9fab7ca7fab6365fc6c9510ba1054ed9e4ae0fb4377f30f167","observation_id":"4644ef79-c8e4-4276-aac2-14c94566a4e0","resolution":{"observed_at":"2026-08-07T12:32:52.287195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.291375Z","title":"Detal: Open-vocabulary temporal action localization with decoupled networks","venue":null,"work_id":"43aa99eb-877c-47c3-8ad9-6d4e818b542a","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.373305Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:7dce0b60f2953705ab8f3a2df3021662c6fe438bedafca9a9854242cf4ac2bee","observation_id":"bffae752-2bbc-48d1-afa2-3ff47b1f1019","resolution":{"observed_at":"2026-08-07T12:32:59.375299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.113510Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"f3b4bc16-d08a-4f5b-9203-88d9466b2a16","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.493479Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:7b20e2727516a12e977268134c570097297c056ec054921a1d96d215ca00cd9a","observation_id":"de9c4524-36a8-459d-9684-22869a55e3dc","resolution":{"observed_at":"2026-08-07T12:32:59.190583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:52.552107Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.552107Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:0b92b5338944b456c0901706e3527dce5d0e113271f9dde9e26c8f34f4c10761","observation_id":"09668194-d388-476e-b1b1-3a5cdb596534","resolution":{"observed_at":"2026-08-07T12:32:52.552107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18111","last_updated":"2024-09-26T17:53:04Z","snapshot_observed_at":"2026-08-12T23:24:06.583327Z","submitted_at":"2024-09-26T17:53:04Z","title":"E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18111","snapshot_observed_at":"2026-08-07T12:32:52.655077Z","title":"Et bench: Towards open-ended event-level video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.655077Z"},"links":{"cited_paper":"/paper/2409.18111","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:24b1cbf6ec30df8762a09aaef10d84403d9e07ddc782729f54a5f98925fde001","observation_id":"039de858-bae8-427b-a797-8f0160f23146","resolution":{"observed_at":"2026-08-07T12:32:52.655077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:32:52.766856Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.766856Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:1bd9489518d5031d88154b21f6e2ca22979a19031dbf691b603f56fa2952a9ea","observation_id":"3d2a4862-2b69-4d78-8e00-51a1e96f90cb","resolution":{"observed_at":"2026-08-07T12:32:52.766856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-07T12:32:52.859271Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.859271Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:16d7a6b7ae2cf409aff0921f6862e60778793e655f6c27533f71a7d8e5583828","observation_id":"a8c5eb12-65ec-487d-8628-b0f2bed9b148","resolution":{"observed_at":"2026-08-07T12:32:52.859271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-13T11:18:51.693524Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T12:32:52.929275Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.929275Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:93143639f535a6afb6858a8d5b6f542b15c45f72b11dcfd5d0e52cd8b79940c9","observation_id":"c1b43079-4c42-428b-a47a-aff1f18e0f89","resolution":{"observed_at":"2026-08-07T12:32:52.929275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:53.040750Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.040750Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:3bd4f2f154e6f811da015ac902c155e60c4fcd6533a114e69fb3259f8ef6c9e7","observation_id":"4941de7b-9f8d-4784-aaf8-718110310073","resolution":{"observed_at":"2026-08-07T12:32:53.040750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-13T05:24:55.951765Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-07T12:32:53.147022Z","title":"Correlation-guided query-dependency calibra- tion for video temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.147022Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2fb9915cf962f1eb11213821a8f4a48105f01262df11a9fa630e86a8c2a8fabd","observation_id":"dfe258fe-aad4-4e4b-8b4d-450c4bd1da09","resolution":{"observed_at":"2026-08-07T12:32:53.147022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:53.284040Z","title":"Perceptiongpt: Effectively fusing visual perception into llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.284040Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:d8a18276987e8ae73596d5a939c0c82fe9705754219f114a3341a19c009cfb52","observation_id":"1d5c674d-ccd7-4949-80ac-ace48b687509","resolution":{"observed_at":"2026-08-07T12:32:53.284040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-13T04:16:52.837049Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-07T12:32:53.366366Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.366366Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:c0975749b70865837f4e96ddd0b3be8053a7d5336554eeb0dcaac2a2c0425c35","observation_id":"0f4567e2-5e6e-4036-9683-4241c6b3734d","resolution":{"observed_at":"2026-08-07T12:32:53.366366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.857967Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"82ba6216-77e2-4fb8-8155-ac0cdd5c0a36","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.420330Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:e00e1db98a99638d7863ec0e7ae005df97519867fa44bb5e6cdda6bd582d0137","observation_id":"37c0725f-863e-457e-bda2-48f82bcbb0eb","resolution":{"observed_at":"2026-08-07T12:32:58.946972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.613758Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"0264fed6-497b-4876-8625-3d6a2426b1e4","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.525437Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:3d1da72adb982a34f86c2fb9acd62c84f976670133ea0cd22681961c34b75b84","observation_id":"be224410-daab-4624-ada5-1d69663abbef","resolution":{"observed_at":"2026-08-07T12:32:58.734554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-08-13T01:33:21.194051Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-07T12:32:53.658205Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.658205Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:032fbb5e938d9f27ccc5d48203c26cfd6c5b8e264a538f3f3855473f40248640","observation_id":"dae1cfa4-b820-47e8-a865-124eaad7325d","resolution":{"observed_at":"2026-08-07T12:32:53.658205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.426499Z","title":"React: Temporal action detection with relational queries","venue":null,"work_id":"9d605c20-3cc1-440e-b905-3bd52c3bb6a5","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.768815Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:eba1e0adfa3c4f8f1aacc4cb6f0e3f19369b43e24dfc3ea6281501bf7d900379","observation_id":"3caff01c-d124-4cdf-9fe6-4f42d9280603","resolution":{"observed_at":"2026-08-07T12:32:58.506942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05590","last_updated":"2023-09-11T16:17:50Z","snapshot_observed_at":"2026-08-14T07:03:58.789357Z","submitted_at":"2023-09-11T16:17:50Z","title":"Temporal Action Localization with Enhanced Instant Discriminability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05590","snapshot_observed_at":"2026-08-07T12:32:53.865330Z","title":"Temporal action localization with enhanced instant discriminability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.865330Z"},"links":{"cited_paper":"/paper/2309.05590","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:524eb697b30cdc8af76530af96122e7b293a4aa62175f500107ff8f155a41418","observation_id":"551e7c59-7076-4afa-91cd-d51c2096a59b","resolution":{"observed_at":"2026-08-07T12:32:53.865330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.211572Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"36ca5d1c-d3ec-4aef-b186-9c352bc278ba","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.939553Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:c2ef4aaec7baf0484343f66adc4c6db880f762690b5f42a8451cf63c0bec466f","observation_id":"5128f6d0-93b9-45d2-abb8-e424557f2f22","resolution":{"observed_at":"2026-08-07T12:32:58.335414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T12:32:54.042453Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.042453Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:7ccafe254b6b24454c785bac1ee0200a81a8b562ede428fc4e2c700bd46aabfa","observation_id":"213c9c4c-bd20-43cf-8c8d-d90308fb481e","resolution":{"observed_at":"2026-08-07T12:32:54.042453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.039506Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"d1f4c707-feb0-4681-afbe-e94a528ce1ad","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.145196Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:637393be40f82fbc5d6b475be668f585e893b002c0542e9d417d6068ae4bed10","observation_id":"1569b71e-42fe-4991-9cb7-2e6b70e55ea5","resolution":{"observed_at":"2026-08-07T12:32:58.125529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T12:32:54.252300Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.252300Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2264b2b15ea6932fae89971d724ba858f84d7d0fdac118f02c033518c9e185dc","observation_id":"ee4104bc-0d5b-416d-9007-440cd0f92730","resolution":{"observed_at":"2026-08-07T12:32:54.252300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.856636Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"88a91c0d-8e4b-493a-b01c-36af0078ece1","year":2025},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.341102Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:255af434be8a5afb8ac075248d0321ee0bb10383bf12878ab5667a58a9998ed2","observation_id":"ee2793be-62f1-48b5-964c-1c8c4c7b02b7","resolution":{"observed_at":"2026-08-07T12:32:57.949737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.653137Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"35ce4b05-7774-477a-923d-5755382f9550","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.441110Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ecd15f9417c3d87ecd038f818d2cb074904b44f10bd867d1f0afd90e87ad6caa","observation_id":"0bd14b92-e188-48bd-af3a-0d310dfc8100","resolution":{"observed_at":"2026-08-07T12:32:57.761265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T12:32:54.522637Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.522637Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:cabfe9b44b242ccfa77efb4ebb613bae28b39e48d726c8014a4da062fba290aa","observation_id":"e29da4d6-2586-4b7a-b153-79b9c7f0bd1f","resolution":{"observed_at":"2026-08-07T12:32:54.522637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.496220Z","title":"Zero-shot video question answering via 10 frozen bidirectional language models","venue":null,"work_id":"0ceed886-2103-47bf-b3b4-56e8a40b93ec","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.633174Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:65ace96bb3a8e90608dfa1ce86092fe9ffbab9cb06202698092121f3c9646ba5","observation_id":"c4afb9bc-f957-4eac-9ddd-24f633e3724d","resolution":{"observed_at":"2026-08-07T12:32:57.564606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:32:54.728045Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.728045Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5c6bc5f703cf51f85e684cdd44dbd7b2a51566a7d4d1e2793b560df12ea27f79","observation_id":"a1c6c84f-88c8-4d7f-876c-e230f0f6b518","resolution":{"observed_at":"2026-08-07T12:32:54.728045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.311756Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"11579be8-8ea8-47ca-9210-d042678217b6","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.841533Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:f2283d6bf9d3ca30c5cf03993591c56a30d9fb807d896a244881c3760fd18298","observation_id":"bce61b1b-d678-4b3d-b4b9-22fe8ddce6b3","resolution":{"observed_at":"2026-08-07T12:32:57.378825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:54.974321Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.974321Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:97158c48096d50f3ddbc173aef8afd5be0f4259bb9109ddd2c66b6818e426999","observation_id":"044d7d47-c453-4bd2-b160-9d8f5f843d4e","resolution":{"observed_at":"2026-08-07T12:32:54.974321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.123885Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection","venue":null,"work_id":"7c51cec7-6923-4380-9687-d9bd9a5492ba","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.048733Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5884d4a4b9113493ab2a305494c66357a6641324bdf004e042e442567ea342b5","observation_id":"c8466171-b24c-4362-a5f6-34e316667057","resolution":{"observed_at":"2026-08-07T12:32:57.232076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T12:32:55.159633Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.159633Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:158f7984cd2179a53412c0288409e733730175ab16ca25bbcb9ee0fca7ded220","observation_id":"53e72cc7-89e6-494b-a7da-65fab8cf662d","resolution":{"observed_at":"2026-08-07T12:32:55.159633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10787","last_updated":"2025-01-18T14:54:56Z","snapshot_observed_at":"2026-08-15T13:21:17.214428Z","submitted_at":"2025-01-18T14:54:56Z","title":"LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10787","snapshot_observed_at":"2026-08-07T12:32:55.288998Z","title":"Ld-detr: Loop decoder detection transformer for video moment retrieval and highlight detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.288998Z"},"links":{"cited_paper":"/paper/2501.10787","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:261a82697b4ba9953999ca5c24dbaa1ca6aa8ab525d670d9d7b7e63e8b18fd30","observation_id":"01593c2e-f8b1-48d3-99d3-1f3a35340e4f","resolution":{"observed_at":"2026-08-07T12:32:55.288998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.967939Z","title":"Training-free video temporal grounding using large-scale pre-trained models","venue":null,"work_id":"314ab90c-c934-401f-b822-2ae8cbcb487f","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.399042Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:c291d27602593b5e486fa5902b6c86354aa6a1a35e7b648a80cfa55fbba7c2ff","observation_id":"4113345c-9176-4ccf-b553-d34527587dff","resolution":{"observed_at":"2026-08-07T12:32:57.043893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.777986Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"01eb553c-2445-4b0a-884c-51c478dc79df","year":2018},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.508617Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:549a30e94529939f680ee84b8b6fc50b71866c61f53e32a8d78ddb17b01c1940","observation_id":"5b333f8d-3dec-4341-a7f5-6a4bb8e52b42","resolution":{"observed_at":"2026-08-07T12:32:56.872197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:32:55.604775Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.604775Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2bcec2f8eb74ee97c70d72344827b3e921de632bb4f495f4f9a313924214147c","observation_id":"6e564994-cdc0-40c3-8e92-e5c81178fd94","resolution":{"observed_at":"2026-08-07T12:32:55.604775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.580817Z","title":"Dedicated","venue":null,"work_id":"c0aad3e8-542c-48b4-b30f-16978495579c","year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.709982Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:343d678444e38107212edd5ec10ce6b0762a23f4d675ef3b85582d85969fb0a5","observation_id":"be464263-fe35-4f22-9094-5c98ea8d6d8d","resolution":{"observed_at":"2026-08-07T12:32:56.674125Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.406851Z","title":"Give you the textual query: ‘thereis an orange barrier out of which people can stand’","venue":null,"work_id":"96b30517-1af7-4924-a8e7-61b0a1e408b4","year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.846636Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:23aff1ca9d4cf35d3c0fa0f055b7271f31d195593e4dbc7772cc12543ea9d421","observation_id":"8b2765c7-1c23-42b5-ba1f-7890ff6a0025","resolution":{"observed_at":"2026-08-07T12:32:56.490871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 5 inbound Pith citation observations for arXiv:2505.24329."}