{"as_of":"2026-08-09T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af06017fecd3c450207dad0c5c5b95de85d08495bb947be0d6e96886e02d27ec","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:41:08.568366Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.918791Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:def76746d639fc1a22d94585947857f420a7a278ae647a5934d4a4cacec26c8e","observation_id":"51649a7d-f4f2-4ec0-8e87-21456cbedbd9","resolution":{"observed_at":"2026-05-17T02:52:20.833571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:d1ff3f9271e910d8bfbf5d0600e93ae7aad2e662c01f25acfc6d6440ffeaae5d","observation_id":"3ca642b1-742d-46e3-9920-106d019fb4c1","resolution":{"observed_at":"2026-05-11T01:20:00.181502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T15:41:08.568366Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14321","last_updated":"2025-05-20T13:07:55Z","snapshot_observed_at":"2026-08-07T23:44:06.171904Z","submitted_at":"2025-05-20T13:07:55Z","title":"Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:08.568366Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.14321"},"observation_digest":"sha256:0468d37f774724681a0bb2505acfa4db918dced44b707d513047a1a2c2fd61d5","observation_id":"73db5c87-2b89-4b6e-abd9-9da8866b837f","resolution":{"observed_at":"2026-08-07T15:41:08.568366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T15:34:55.930004Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-07T20:35:28.075030Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.930004Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:d8867a32786b8801a65f8c7f04bf74d847c5293fe3399e337e36d3212c0c4aac","observation_id":"208b340b-771f-4eda-aa3a-b4fde362b2f0","resolution":{"observed_at":"2026-08-07T15:34:55.930004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T14:14:47.811975Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv preprint arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.811975Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:2bc1be6817137605f56fd87c3a2b81f91a7e8f166218978d144c9c8868379850","observation_id":"3e01e98a-c288-4951-bc8a-ad6f1c0fdcf2","resolution":{"observed_at":"2026-08-07T14:14:47.811975Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T12:37:24.588694Z","title":"A. High heels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-08T09:10:29.505160Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:24.588694Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:9226a2aec6f3cf3ef4afa9581954b4ec43d654505ce5df7f04abfc5f44467eda","observation_id":"447bbede-b0be-4fbc-9feb-22827ba5a7bd","resolution":{"observed_at":"2026-08-07T12:37:24.588694Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T11:59:11.354129Z","title":"Apollo: An exploration of video understanding in large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:11.354129Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:ffaf46d96c552297efd5ba478ca4fb56f95424a24c600ec937af4a2532454f32","observation_id":"0ff19277-4d81-42ea-a6ca-e0b1fdb91644","resolution":{"observed_at":"2026-08-07T11:59:11.354129Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T11:18:16.401147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:16.401147Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:8080d59ed9801e2ae90cdd39b18dc4343f36bd2df84d488f6b4334e4d61a40bf","observation_id":"1ab9b6da-ae28-476b-9d98-ef9bd5fe884c","resolution":{"observed_at":"2026-08-07T11:18:16.401147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T05:41:39.827734Z","title":"Yes” (confirming the presence of information in the video) and another “leading/hallucinated","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07371","last_updated":"2025-06-10T13:33:53Z","snapshot_observed_at":"2026-08-08T15:59:53.622703Z","submitted_at":"2025-06-09T02:42:13Z","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.827734Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.07371"},"observation_digest":"sha256:dbc1c56aedacafffe88bebccc31881c6df9f51319494ca455f6c55a6a8cd5d9f","observation_id":"1645717c-29a1-4eb3-8e9f-e7e2978c2325","resolution":{"observed_at":"2026-08-07T05:41:39.827734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T22:24:36.976093Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv preprint arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:36.976093Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:1d66db5b1dcfe653bd55f6843e3d964da20993ce529cbdcfdd9a1a940d3318be","observation_id":"aff8f26f-bed7-41c0-a3c2-a8a286242dcd","resolution":{"observed_at":"2026-08-06T22:24:36.976093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T20:29:57.031289Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:57.031289Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:1bfdcbe44938bef0d88575b10712615ee0507536594f13688683785fb05cf37f","observation_id":"0a20b61a-a85a-4611-93dc-11fbe6e68ff3","resolution":{"observed_at":"2026-08-06T20:29:57.031289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T17:55:45.498173Z","title":"id\": \"\",","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-09T02:39:23.430677Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.498173Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:aaad387ac8831e61e446d3e1d248f3f7392396226391c5e41abfd00ca781a509","observation_id":"5f9be675-8665-4051-ba81-0ff362f1473c","resolution":{"observed_at":"2026-08-06T17:55:45.498173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T05:15:43.575145Z","title":"left” and “right","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:43.575145Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:abeba33f4bebdbe831dc548b2dbc3df6ef613afc20a2014c1d58d102cafde3a8","observation_id":"44079027-0ad8-4f25-8acd-0306ad0d4fb3","resolution":{"observed_at":"2026-08-06T05:15:43.575145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T05:12:38.512195Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.512195Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:36a03a1f1406e3dca5a1deda3f0c7880a03026426b8c195462ace8a28e8eda26","observation_id":"6cf8de07-4242-40f0-a445-23d5848dd7d5","resolution":{"observed_at":"2026-08-06T05:12:38.512195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-05T11:27:47.145067Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-08T01:59:20.274765Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.145067Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:a60e3282346421d964af56b777e52a26f18ddf1bd89a33234b29ee8476e0f22a","observation_id":"4ebc1d82-7cb1-49f5-9264-9aaf78b8426d","resolution":{"observed_at":"2026-08-05T11:27:47.145067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:9ccf0f4e33ed97cf27983320c9b56a43f9f2d54cf3f8cbffe45e42bd08aa637c","observation_id":"bf372c0d-9bca-492b-a2ab-78d4e97b3cb7","resolution":{"observed_at":"2026-05-16T22:21:18.860880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2604.17375","last_updated":"2026-04-19T10:58:40Z","snapshot_observed_at":"2026-08-02T21:21:44.410489Z","submitted_at":"2026-04-19T10:58:40Z","title":"When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T06:41:59.641410Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2604.17375"},"observation_digest":"sha256:1515f020ac17adca08f23a449bb87087deac6b3347ed3af8e33c1cd3d5a67ccf","observation_id":"318777ff-820e-4174-8411-3e46e8365194","resolution":{"observed_at":"2026-05-10T06:46:37.520929Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2605.21625","last_updated":"2026-05-20T18:36:57Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:36:57Z","title":"Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T09:20:32.920925Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.21625"},"observation_digest":"sha256:f1ae4ecf12f912675f045a2de3edef37c3bad69f854a12775ed3bc0f1e761f96","observation_id":"e639179c-8052-4189-8f40-7fd587b4e7c3","resolution":{"observed_at":"2026-05-22T09:21:20.639077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:df54eb298eece7634bb142b3ac13af1dc25caaa1722bfed9a99e995e3bc38538","observation_id":"0a37124e-a73b-4485-b966-0c8d1371122d","resolution":{"observed_at":"2026-06-29T22:13:59.596352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":"Apollo: An Exploration of Video Understanding in Large Multi- modal Models, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:e6a68d838bcebebc688d26051e504c1245b517fc9cda666bc12bf7242e33a350","observation_id":"3113e5cd-019c-4b5e-9caf-e93928e905c7","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":"Apollo: An Exploration of Video Understanding in Large Multi- modal Models, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:06b47a8441cb98b255cc153644b2fdcdc86210d4253301c3c8b96b2569168b28","observation_id":"842d6468-15ae-4852-8695-f90881a5b040","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:c1c480bc1d8f179633ed0c045143a06fbfa5ea32fe49851649aad94e09883c4a","observation_id":"e62a9e4e-ff01-4793-b538-68d25de14127","resolution":{"observed_at":"2026-07-01T19:16:01.314765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":263,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f0394f594d86fdda83c0473a5832be125c3d52c2e084b50415210c58ce903a5b","observation_id":"1b33d8c6-4bb1-49b1-bbfa-ae9e82327cbc","resolution":{"observed_at":"2026-07-03T10:48:02.920378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2606.29472","last_updated":"2026-06-28T15:59:31Z","snapshot_observed_at":"2026-08-01T16:45:40.105247Z","submitted_at":"2026-06-28T15:59:31Z","title":"Agent-Computer Observation Interfaces Enable Dynamic Computer Use","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:20.295818Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2606.29472"},"observation_digest":"sha256:265bffe4c0229b9912747aaa7c41b41aa1a8e878b4790170b7d8b3d3dff9fb3e","observation_id":"c9dbe76f-b26c-4668-9b61-2ec3dea2696c","resolution":{"observed_at":"2026-06-30T07:04:21.211164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10360/citation-record","integrity":"/paper/2412.10360/integrity","json":"/paper/2412.10360/citation-record.json","paper":"/paper/2412.10360"},"outbound":[],"paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2412.10360."}