{"as_of":"2026-08-10T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3cbfd034166cfac52ea6e698fb39208c0a341bd1634f8b06850ae8ec9ae40b6e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:49.012698Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15529/citation-record","integrity":"/paper/2505.15529/integrity","json":"/paper/2505.15529/citation-record.json","paper":"/paper/2505.15529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.664674Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Kar \\' e n Simonyan","venue":null,"work_id":"a138d243-0011-4351-85a2-00832f718c3b","year":2022},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.435871Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:3a2ff434ffc5d0e806a6abe6db84b3f5965c6f2d58d3e281d5614394d32f1807","observation_id":"8f111aa1-f365-4e08-a008-587d8d0b50db","resolution":{"observed_at":"2026-08-07T15:20:51.732946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.514469Z","title":null,"venue":null,"work_id":"97f19036-3020-445e-8e6b-1db0ae5990d2","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.511993Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:34ba7b6f56a385390b300c7fe61324cdd5d86bf9e7bc9f14e559462168afdb52","observation_id":"4757746a-bce9-4cbc-b8e7-4def18f07d21","resolution":{"observed_at":"2026-08-07T15:20:51.581798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.274171Z","title":null,"venue":null,"work_id":"f0075843-ff1b-4ed2-a8d8-70d7d53193d3","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.586369Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d48bdfe85c32d6dd24c49369dfdfa22d5fc90d4cfebe11b77ea33585d1599233","observation_id":"7e5aaeaf-d987-421e-b41d-72332f633ec6","resolution":{"observed_at":"2026-08-07T15:20:51.407479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:20:44.667515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.667515Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:6614c6ebc44dd50192e9b79f348b443a58b75230c75d5164bf429b1e92327639","observation_id":"aeb95aec-7c5b-48a8-9143-5c9c25861d5b","resolution":{"observed_at":"2026-08-07T15:20:44.667515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T15:20:44.764951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.764951Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:83bc77e987e93f05e9b85cf13226d86782ad1b8e5aacb5fea128f426869de3d8","observation_id":"89c9b623-186a-4330-be78-cabcf333b42b","resolution":{"observed_at":"2026-08-07T15:20:44.764951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:20:44.871031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.871031Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:30fec3dd64fb2199ee61b13e0fdee94b968078f28d610ee66161358a7e3eb488","observation_id":"042da8ab-4e83-4132-bc45-8a49da6f3094","resolution":{"observed_at":"2026-08-07T15:20:44.871031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:51.119828Z","title":null,"venue":null,"work_id":"9011758f-f8e8-41e5-926c-70d2b9e2b0f8","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.997198Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:770ccb148ed7f341e0ea4c69d28c53ce126536664041c35a2145bd3464ad2ce5","observation_id":"9df7712b-7efb-4210-95f3-c02909292127","resolution":{"observed_at":"2026-08-07T15:20:51.190608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T15:20:45.092112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.092112Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:de9c2592e17748d25be9fd52d913dcf031bc3fe9b55811fefa3f6be80a64b787","observation_id":"6537dfb7-4d62-42b2-8b9e-152561038d2e","resolution":{"observed_at":"2026-08-07T15:20:45.092112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T15:20:45.191691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.191691Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:b40fa8e82de272a8aeedbca8493dae81cc655495dd204dbcd46755b6a9c66999","observation_id":"32001848-f00c-4b73-b278-eb58c1f57253","resolution":{"observed_at":"2026-08-07T15:20:45.191691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:45.283481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.283481Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:955cd8437df8e4179c1ff714e5dbfc145689a3a99d08d1e1fa30ef166569cf3c","observation_id":"fc5946e2-dd72-48a1-a1bc-98da3fea1e84","resolution":{"observed_at":"2026-08-07T15:20:45.283481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.904892Z","title":null,"venue":null,"work_id":"8db6c8d2-bc2f-4189-a146-3c1722f8f257","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.401124Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:cde095f2dfad2f2db1d06051abe8886dde6dd1763c9ec463bf0dfec2e8df72b2","observation_id":"568b2f86-13e7-4fb3-bedd-e721c409f31d","resolution":{"observed_at":"2026-08-07T15:20:51.011985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.689501Z","title":null,"venue":null,"work_id":"856d059d-2338-46a7-8a1d-7f14c398fbae","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.516975Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:a244d3b67296b7fbe10b3004ae33d38fe2cff581ec073879c4be908e0b21353c","observation_id":"6dcc8ae6-4df9-4b87-a376-5dbf66e45257","resolution":{"observed_at":"2026-08-07T15:20:50.816531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:20:45.618643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.618643Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:9b9256633982b2ad4d5028e8b7ac53a4b270164031b3ad5c350d5051ce3ea487","observation_id":"0833c6ca-2656-44aa-93b4-173aa01292d6","resolution":{"observed_at":"2026-08-07T15:20:45.618643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-10T11:57:00.228306Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T15:20:45.733144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.733144Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:004cc3ad3c8a40b518580e8e62f2aa445892113193f43b12ea835306a1327ad7","observation_id":"81ccf352-fc30-40ad-a176-ed4d766704f4","resolution":{"observed_at":"2026-08-07T15:20:45.733144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T15:20:45.814866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.814866Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:f4c4c87478fc0056b97a36275afeb116114cdaf5dabb3bb707c591b5f5f1fd2b","observation_id":"69f0435a-ef32-44d7-b5ee-a8290edf9e0f","resolution":{"observed_at":"2026-08-07T15:20:45.814866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:45.926076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:45.926076Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:fcf0b1e03dd17c4754965d985068b1b34480fb0788da3fb11c21eb1c4f940350","observation_id":"68cd9ea3-10f6-419d-b479-3cc699219b56","resolution":{"observed_at":"2026-08-07T15:20:45.926076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T15:20:46.025304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.025304Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ede328bd9d2ebcbe74af98572410de52a6b31bd8e21d5f39645a826e98ceb561","observation_id":"5e32be1b-96f0-47c5-a829-3e799dc63adc","resolution":{"observed_at":"2026-08-07T15:20:46.025304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:20:46.130255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.130255Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:0a8644850507d1a56b21473602763f008e6f4f37c77ad5fd333f8141978ac735","observation_id":"2c42a8a7-e8b0-4b89-a580-674d9dd00723","resolution":{"observed_at":"2026-08-07T15:20:46.130255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.240845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.240845Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:94590f4be824f468e0a10ae54a3e086880a8f9d455f76e13345cf51e2d6e39c7","observation_id":"29148629-9ec8-41a5-8c18-a42e3e65cfc3","resolution":{"observed_at":"2026-08-07T15:20:46.240845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.356809Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.356809Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d851fc1e54bdaefcd176df725ca9e9a0e93e1e42126733b186f3c2afe307a3a1","observation_id":"ccdf8af0-55ec-4984-87a4-2d1ccafd23d7","resolution":{"observed_at":"2026-08-07T15:20:46.356809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.438533Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.438533Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:47f12e0ee61a999d4ade820d0c88960954dabfabcd7d653691e8c693043db2f5","observation_id":"11bfe300-e9c2-47e6-91a2-4e1d3cdb879a","resolution":{"observed_at":"2026-08-07T15:20:46.438533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:20:46.538312Z","title":"Lillicrap, Jean - Baptiste Alayrac, Radu Soricut, Angeliki Lazaridou, Orhan Firat, Julian Schrittwieser, Ioannis Antonoglou, Rohan Anil, Sebastian Borgeaud, Andrew M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.538312Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:95df16d6e3583f318e8d84deb25945b527f9832d7a3b249a5ace83eaef4aee03","observation_id":"53be6b26-fba9-45f5-9341-c07df4c0678b","resolution":{"observed_at":"2026-08-07T15:20:46.538312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T15:20:46.656613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.656613Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:6942e673f7695dec9cdba50e280871aed9819b07f57f2d0f8a29fe9a197f9974","observation_id":"df10b4bf-19b9-4cc1-9cda-ea7ba31abd8d","resolution":{"observed_at":"2026-08-07T15:20:46.656613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:20:46.774925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.774925Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ef19a8a7c58f94e8d6a4a972cde4758cbc8c002873536992d8435d4dacee8a70","observation_id":"8e97a8a8-ca31-4697-95fb-48e4305a115e","resolution":{"observed_at":"2026-08-07T15:20:46.774925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:46.882268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.882268Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:1395fa94f381311ff80d5b2623f71e770d22882f43eb7c56c1317852479a58b8","observation_id":"4e8687f3-97cb-4618-809d-b22cb0a964e5","resolution":{"observed_at":"2026-08-07T15:20:46.882268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.428242Z","title":null,"venue":null,"work_id":"e94ec6be-4f47-457b-b421-7b705b37bb1d","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:46.992993Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:9dc6c62389d7d3818d875c1e76ad7955bf0190d64c83468b53a3e3ddf8afbb36","observation_id":"52373ded-3d67-44cb-b8ae-820b898f4e2f","resolution":{"observed_at":"2026-08-07T15:20:50.489650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:50.188303Z","title":null,"venue":null,"work_id":"2ab7d68e-d1f8-4f52-a7b4-ea7de6894b05","year":2025},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.097954Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:2b2fbf25d196ab03a77d449832e59fee6b66ca5bb78df804eb529de645d42d6b","observation_id":"e80577a3-53a0-4e6a-b701-074b0ce0ca31","resolution":{"observed_at":"2026-08-07T15:20:50.314362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:49.982662Z","title":null,"venue":null,"work_id":"ea57b19f-ca98-43ac-b333-f63eb3f13e28","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.209607Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d287b0205539d606a8165a2d75f1beccde15b4c96013ab39529d55261eb9fd06","observation_id":"6d1c5864-6482-4522-bde2-8406b87655e1","resolution":{"observed_at":"2026-08-07T15:20:50.061845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:47.360957Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.360957Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ee7cf59e872c40d418774b759c624e3f4d80fbf85833926bdd2552d3ea6154cb","observation_id":"65d26525-3b22-4b76-8c52-335ada6560d3","resolution":{"observed_at":"2026-08-07T15:20:47.360957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T15:20:47.442019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.442019Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:05a23369fbab8cf15199ba94fe6123ba901068d3ea16c96ca9e53203292a4fd1","observation_id":"4e19bcb9-4faa-4af7-8a25-9f01f45e34d9","resolution":{"observed_at":"2026-08-07T15:20:47.442019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-08T03:13:28.000968Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-07T15:20:47.549466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.549466Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:593e375a0a8d1e568eb33cb3064c06753d2ba7f8449fa2dc6c6e55aaaca501bb","observation_id":"0a170583-a703-4bcf-9e43-4138824d1160","resolution":{"observed_at":"2026-08-07T15:20:47.549466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T15:20:47.582468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.582468Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:2887f43239df9f1c40ef0e0cc567cda614cf0e2cd859ec816a9a43605166077b","observation_id":"504d6f4d-54f0-4a77-8703-264b2636ec34","resolution":{"observed_at":"2026-08-07T15:20:47.582468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T15:20:47.666280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.666280Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:26eda0d69be7da2f903387057e86f07328e8785db651b724ea1102350af61d91","observation_id":"3b7b5785-9727-433c-8acf-043e29bc57cb","resolution":{"observed_at":"2026-08-07T15:20:47.666280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T15:20:47.766618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.766618Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ab8784729a51c4e16a0d2293091c59dcbdf29368eca076ff9070607a91b8da96","observation_id":"dcf3998a-0299-44c7-99b1-60537273aa35","resolution":{"observed_at":"2026-08-07T15:20:47.766618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-07T15:20:47.848486Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.848486Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:996d7628f0709e87025d537ff6d1cc22fc295ee0b311f5aa808c6813094843d3","observation_id":"6123c3b3-0e54-484e-b7dd-3352b9d48e95","resolution":{"observed_at":"2026-08-07T15:20:47.848486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:47.964092Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.964092Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:5b5c5e4d1708eae0ed68a823436dbeeb117023ae99165fd4e136e711043f9a82","observation_id":"b7036e20-0a50-4793-a074-fb882ae4e945","resolution":{"observed_at":"2026-08-07T15:20:47.964092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:48.040187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.040187Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:6fc28deb7c2d305acc6337659f050e85254a8b532735aeb95ba5b38cbe1427ef","observation_id":"b080d67c-5c39-4dbb-8d51-116ecac20bc5","resolution":{"observed_at":"2026-08-07T15:20:48.040187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:48.150431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.150431Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:0e4866ba494ec59fce86cfeeb685346231d4c9c557e16dbcddc58ac70849c193","observation_id":"e0f45e9c-7100-445f-a5c3-ea4118e6ebbc","resolution":{"observed_at":"2026-08-07T15:20:48.150431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T15:20:48.289056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.289056Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:3676a5268724de16cf1d761a82860f075a4c6edf113350487b5c0ff8d9065291","observation_id":"cdfe6a61-b8c6-4b66-8526-ef453138e929","resolution":{"observed_at":"2026-08-07T15:20:48.289056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T15:20:48.439015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.439015Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:2fd0f0400c1b57153c22517b64eb82832cfde6945344fd855fd371b83bb7c4e3","observation_id":"0fec3900-d476-4a76-b440-735d2d295676","resolution":{"observed_at":"2026-08-07T15:20:48.439015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:20:48.560323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.560323Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d7e3962af686eb70871e379b2d1bf51c1003b0cde95a9da292127a420ffb0ae2","observation_id":"896f522a-1fd3-4c1f-9435-e1462eb735e9","resolution":{"observed_at":"2026-08-07T15:20:48.560323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T15:20:48.669699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.669699Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:bca37bea3b8dfc2bee51e302c34a7077745bbc03c370996f7e31de405ff05795","observation_id":"a2c8dda5-b1a7-4752-a01d-d624987f1540","resolution":{"observed_at":"2026-08-07T15:20:48.669699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:49.741017Z","title":null,"venue":null,"work_id":"ab0e5f08-4127-49eb-903a-4e0b7be84ca6","year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.791387Z"},"links":{"citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:73ee501c9771e251e89e68106d56e49cc62f91c5837a68b8675a94e2f9ef90ce","observation_id":"61da8d38-d993-463d-b042-23d06d7753db","resolution":{"observed_at":"2026-08-07T15:20:49.835526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T15:20:48.883282Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.883282Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:3bc746d001aeff83079380209d3d34abeaec2266fc8895f462438bd69c9515a8","observation_id":"8eacf7cc-13ab-4b30-9181-67af9725b7e1","resolution":{"observed_at":"2026-08-07T15:20:48.883282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T15:20:49.012698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:49.012698Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:0991851156425b48097f5a0c149f55e3dc69a70df41fca6698e1ab66d4bc3701","observation_id":"20c7a929-9e13-4928-860f-e2097167ac49","resolution":{"observed_at":"2026-08-07T15:20:49.012698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.15529."}