{"as_of":"2026-08-13T04:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d68a3d7277ace76c11ab8850fd0a3f55b8d23b9dab44596e17e4b0f2b9e3ca2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:28:30.295762Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.643725Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:d8172aeadced6040a2db2eb7fe9eb224b380c66e8dca4d16cfc604b237b23b89","observation_id":"2894a04d-1d74-4417-a654-57b721d1551d","resolution":{"observed_at":"2026-05-17T02:46:16.807356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:2485cab9386c53c56edcf33bf3838c41030a45113c7fc3dbec3c0d059b5fa717","observation_id":"cd0c9261-42f4-4beb-8ad3-e83f25ecae50","resolution":{"observed_at":"2026-05-14T19:55:26.427758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:f8c16adaf2d8d00b2e713c43b5371c2c998f3610b5c7786646bab781147f7b69","observation_id":"e1fd15f6-ca78-464e-9243-f4693104d822","resolution":{"observed_at":"2026-05-11T02:44:53.620986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:183d9a0fdba109c544e3ea8d5dfb785104eb2ea3985b49f86a718aa598e94b01","observation_id":"ed7db905-7503-481c-b1d0-c2d6a37bc33b","resolution":{"observed_at":"2026-05-19T11:55:30.099872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:d5f44bcfc53bb72eeb48d1404c3bd1c9b3067ab4fb096594827e789a36194de1","observation_id":"ca324a57-d643-4590-a8bb-7f477c6345fe","resolution":{"observed_at":"2026-05-16T20:10:27.687282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-12T15:28:30.295762Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14205","last_updated":"2024-11-21T15:13:38Z","snapshot_observed_at":"2026-08-12T15:23:13.210738Z","submitted_at":"2024-11-21T15:13:38Z","title":"Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:28:30.295762Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2411.14205"},"observation_digest":"sha256:13797d52ce678bc20a07a2fc0aea600ba0f05aaf15022d3ab475877cc11c6e28","observation_id":"b67c3742-40f5-42b3-b43b-dd0707f0f87f","resolution":{"observed_at":"2026-08-12T15:28:30.295762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-12T11:27:56.200232Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-12T14:25:01.260850Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:56.200232Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2411.18211"},"observation_digest":"sha256:3f5f7c7070293ec30426afa45ae2858ce065d9c654be7318ece9c40ba2c1f1d8","observation_id":"a4734340-4adb-44c2-9d6d-602906a85036","resolution":{"observed_at":"2026-08-12T11:27:56.200232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-11T16:51:15.245087Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10471","last_updated":"2025-03-10T03:35:16Z","snapshot_observed_at":"2026-08-12T21:52:37.427090Z","submitted_at":"2024-12-12T23:39:54Z","title":"VCA: Video Curious Agent for Long Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:51:15.245087Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2412.10471"},"observation_digest":"sha256:07ac39278cee7a9f8474c10d44fefa3dbf03f10159c7c27129237f578e8eae21","observation_id":"00f39dc4-3c86-4e6e-8c63-c06ad75c3438","resolution":{"observed_at":"2026-08-11T16:51:15.245087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-11T00:47:12.355668Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-12T16:53:42.600067Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.355668Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:be8e6a5f2a1d868b2274d205c6473bf6822a7202725c687806dfbab756f50dce","observation_id":"a3e98c36-3502-47d6-b542-48226d44bbbe","resolution":{"observed_at":"2026-08-11T00:47:12.355668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-10T22:32:55.519932Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-10T22:25:36.091919Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:55.519932Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2501.01428"},"observation_digest":"sha256:da7bfd4784babfee3bba1e8b7a3c28791a33afc1857e1bec9ee96a62fbd97c34","observation_id":"eebf7881-e136-4104-8bed-c34d43582f63","resolution":{"observed_at":"2026-08-10T22:32:55.519932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-10T22:19:53.497615Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02135","last_updated":"2025-01-03T23:03:24Z","snapshot_observed_at":"2026-08-10T23:06:48.073542Z","submitted_at":"2025-01-03T23:03:24Z","title":"AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:53.497615Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2501.02135"},"observation_digest":"sha256:0e985991e0ed130e2727d0d1464e459d006a0032ecdb8491c5f13d2f696b602e","observation_id":"980131d7-c4f1-4d64-a340-6fb74a1ff9e0","resolution":{"observed_at":"2026-08-10T22:19:53.497615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-10T20:34:12.264313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-12T14:14:40.712784Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.264313Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:74189c85288421ec4497434db01f819b7474fd546001b5f019cb5b812fa939ab","observation_id":"1124415d-0c4b-421a-a124-df65e9d5acbc","resolution":{"observed_at":"2026-08-10T20:34:12.264313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:b349cdec47893dc0d10beb01c6790a4eefa74de9f2ea8c976495c76ac53e85f4","observation_id":"74733113-350f-4079-852c-d6a93c738232","resolution":{"observed_at":"2026-05-17T02:52:20.762202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-08T17:37:38.120634Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05887","last_updated":"2025-02-09T13:00:53Z","snapshot_observed_at":"2026-08-12T15:15:40.745110Z","submitted_at":"2025-02-09T13:00:53Z","title":"MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:37:38.120634Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2502.05887"},"observation_digest":"sha256:87be20667555ce07470ef396a624bf2510fe2c5bfbcd231e9c439eb05122b2cc","observation_id":"b7bb7727-ba7d-4ecc-ba1e-6079cc4e9f21","resolution":{"observed_at":"2026-08-08T17:37:38.120634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-07T13:08:06.501876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-13T00:07:33.143025Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.501876Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:dc9a8972df4f4ff9d24c5ee2b28d6ab7df4bc0d84d06dadc7d3f82f7aa5dcea3","observation_id":"0bbf7527-2e0a-43dd-8862-846ec2812208","resolution":{"observed_at":"2026-08-07T13:08:06.501876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-07T10:17:17.607966Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05787","last_updated":"2025-08-04T22:48:35Z","snapshot_observed_at":"2026-08-11T12:34:16.007411Z","submitted_at":"2025-06-06T06:33:16Z","title":"EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:17.607966Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2506.05787"},"observation_digest":"sha256:9c2fcc11b36c1dfed08d8ac3af144c8b268c1d6361ff73c2050ff247fb407fe4","observation_id":"db37397a-99a4-4b89-a1ef-8f05e1286840","resolution":{"observed_at":"2026-08-07T10:17:17.607966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-06T22:24:31.342995Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding.ArXiv, abs/2312.02051, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:31.342995Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:564b1cc5c02eeb3fb1ff4ff2449d83c58cc1924be7ade24297607fb463dc8a6d","observation_id":"039f19b2-59e5-41e2-b0c1-42a3e1a0c856","resolution":{"observed_at":"2026-08-06T22:24:31.342995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-06T22:20:12.971888Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21891","last_updated":"2025-06-27T04:05:12Z","snapshot_observed_at":"2026-08-10T08:13:06.722091Z","submitted_at":"2025-06-27T04:05:12Z","title":"DIVE: Deep-search Iterative Video Exploration A Technical Report for the CVRR Challenge at CVPR 2025","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:12.971888Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2506.21891"},"observation_digest":"sha256:e6d2d860f13f2462eb7bac0289965cdbf828f56cb22356494d042275235d267f","observation_id":"c76d8af5-6ecf-405e-8499-77ad6f20ccc0","resolution":{"observed_at":"2026-08-06T22:20:12.971888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-06T22:00:06.968000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00068","last_updated":"2025-06-28T12:12:06Z","snapshot_observed_at":"2026-08-09T10:41:05.778908Z","submitted_at":"2025-06-28T12:12:06Z","title":"MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:00:06.968000Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2507.00068"},"observation_digest":"sha256:0604987541a37ad981c6d6d537bae804b723c733ba3238877dfe1319e216a40f","observation_id":"ce5d04b7-30d0-4adc-8fce-0d5913fe9b60","resolution":{"observed_at":"2026-08-06T22:00:06.968000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2604.02860","last_updated":"2026-04-03T08:26:12Z","snapshot_observed_at":"2026-08-11T13:13:07.327843Z","submitted_at":"2026-04-03T08:26:12Z","title":"A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:57.298338Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2604.02860"},"observation_digest":"sha256:d29ff0419bd744b8c68d6ecaa25550e94200819d13ebb5aba66c0bcf2a42f348","observation_id":"b85caa48-9723-4b62-a11a-6e2c148e0057","resolution":{"observed_at":"2026-05-13T19:48:11.525080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T14:10:27.416341Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:c73b8d51fd87e0bfb48f4f94a2cd3b3e043612c60dbace013b72b13a40cd88fb","observation_id":"bbc5f630-013a-40d7-a1a7-2ec06f18f519","resolution":{"observed_at":"2026-05-12T00:46:13.738281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:c8e2ea391ff71a37128344c75f81788c60c50e5ec6442d45a11ce237f836fb05","observation_id":"7ba36f90-8d5b-4224-860b-09a8bac66510","resolution":{"observed_at":"2026-07-01T08:45:34.755963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:343fb06d56cbb263f7babd9daf346c9474cb5e75d0b88c65d3810b38a56b31f2","observation_id":"62853dd5-b767-49ba-a9a9-4a13f37bcfab","resolution":{"observed_at":"2026-06-29T22:13:59.539308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:6cc44a22eaae63ed69eb1de9db0fae10835cd72a339d2e84da485dcbdac762f1","observation_id":"c5036575-fc9c-419e-84c4-37101201c4e5","resolution":{"observed_at":"2026-07-02T12:46:56.832350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:d27fd49cc735df075bd4fa0bd560de9f4f546bb3a4c8f3ff49f0ff2b6a907bb6","observation_id":"99f19cce-399a-45ea-af49-7a991abf30fc","resolution":{"observed_at":"2026-07-02T17:27:15.504136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:96dca27cea36c9880f8f05b693f5488c99a108e0efb6c8cabf01a2d2105495ac","observation_id":"720ab0c3-e66d-454c-a5d5-e85fc57d5822","resolution":{"observed_at":"2026-07-04T06:39:37.645127Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.02051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-04T06:39:37.643725Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"85fc1396-2fab-4238-9120-5878dc1705b6","year":2023},"citing_paper":{"arxiv_id":"2607.00867","last_updated":"2026-07-15T08:03:34Z","snapshot_observed_at":"2026-08-02T09:17:20.227144Z","submitted_at":"2026-07-01T12:32:29Z","title":"EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-02T14:19:04.890074Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.00867"},"observation_digest":"sha256:d2fa06823cddef9da6cf804f4fb76b51a582045aa3edc24b3829f2e4aa9b2bba","observation_id":"3e1094fb-58b5-43cf-8056-6f2b0e2139b4","resolution":{"observed_at":"2026-07-02T14:27:03.324975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-12T09:13:38.446621Z","title":"Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Luke Zettlemoyer, Nicola Cancedda, and Thomas Scialom","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.00867","last_updated":"2026-07-15T08:03:34Z","snapshot_observed_at":"2026-08-02T09:17:20.227144Z","submitted_at":"2026-07-01T12:32:29Z","title":"EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T09:13:38.446621Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.00867"},"observation_digest":"sha256:98b47e207fbdcf37c453bd39dac570d633c5e28cd0538940a2c9c1271898ef54","observation_id":"af988246-9c7f-4120-a332-cdde69102010","resolution":{"observed_at":"2026-07-12T09:13:38.446621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-02T09:17:20.566842Z","title":"Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Luke Zettlemoyer, Nicola Cancedda, and Thomas Scialom","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.00867","last_updated":"2026-07-15T08:03:34Z","snapshot_observed_at":"2026-08-02T09:17:20.227144Z","submitted_at":"2026-07-01T12:32:29Z","title":"EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:20.566842Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.00867"},"observation_digest":"sha256:0816334c758b25e1dcf80c73f3216b63db280c7c00826ce39b8e74f74065a049","observation_id":"66d9599d-a935-4146-8499-6ec150eea4e5","resolution":{"observed_at":"2026-08-02T09:17:20.566842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-06T08:59:01.715141Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:1496ef14f25580e084b75bf758d4e04b5917118dbc90a2f49ee172f6a1484957","observation_id":"0e22faf1-5308-4869-a1b5-4ca00032fe8c","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Timechat: A time-sensitive multi- modal large language model for long video understanding.arXiv preprint arXiv:2312.02051,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-08-09T15:42:44.711926Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:1a6152883c108e0e031291c4385769a16a429b549ab152cc1b07fd801d15f2d1","observation_id":"ddf24105-f1b7-4d79-bbad-836acba77bba","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-01T18:04:15.439960Z","title":"Timechat: A time-sensitive multi- modal large language model for long video understanding.ArXiv, abs/2312.02051, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.439960Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:fc2189af142dc4c274dcadc4dc98c2a251a08c44c4d1f6b1f1cd7c6b7ada1175","observation_id":"b0c52bc0-b812-4f45-9d1b-c2b9ab76835b","resolution":{"observed_at":"2026-08-01T18:04:15.439960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-31T23:32:53.515428Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-07-31T23:32:36.040113Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:53.515428Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:80d4211d80e33a11ddd81aedd70ee9d27a39d8e84c07d5a21162a9960a929ace","observation_id":"75c7b714-5509-4238-bc47-182e8a457c22","resolution":{"observed_at":"2026-07-31T23:32:53.515428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-04T17:24:16.109594Z","title":"2312.02051 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01980","last_updated":"2026-08-03T09:42:42Z","snapshot_observed_at":"2026-08-11T15:40:04.127681Z","submitted_at":"2026-08-03T09:42:42Z","title":"AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T17:24:16.109594Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2608.01980"},"observation_digest":"sha256:58dfa2423bed80fa5f830dd28eb6426c0d27f299a65f663e6329eadb7fb710cc","observation_id":"7373f027-c75e-455f-a08b-410c4054f616","resolution":{"observed_at":"2026-08-04T17:24:16.109594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.02051/citation-record","integrity":"/paper/2312.02051/integrity","json":"/paper/2312.02051/citation-record.json","paper":"/paper/2312.02051"},"outbound":[],"paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T13:36:40.776714Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2312.02051."}