{"as_of":"2026-08-09T20:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55b58050262139a163953a1b23855268308d101641db73361356d040458f874b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:41:44.453339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:17:29.025254Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:ea002871ddc6a4af6f0f132f8090b52ba830f3906176fd332a5605b4d362b838","observation_id":"6f81342e-bd97-4abe-baba-5a01192baf65","resolution":{"observed_at":"2026-05-11T10:56:08.956957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:5a024dc62f4f6b0e4803eeb03a9f26f44799cf8be76688013c30a6bf33448607","observation_id":"a8f2966c-ba4d-41d2-9f6c-40cda4fe35e9","resolution":{"observed_at":"2026-05-15T22:09:16.163144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:69d5af554b5291377d285f7152763001bd4f3df1be6b2029ae07e7a7377842af","observation_id":"b65a97ec-b51e-406b-b27d-24f6728f9732","resolution":{"observed_at":"2026-05-11T10:09:24.036364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:c212c796a1c9d0e0e5d79cafe5d9770a5ac0a74af80b1a65e314fb14c23e312d","observation_id":"1c76186e-249a-4591-8610-c7f7bf3feff7","resolution":{"observed_at":"2026-05-11T01:19:59.819018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-09T11:41:44.453339Z","title":"Densefusion-1m: Merg- ing vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02589","last_updated":"2025-02-04T18:59:46Z","snapshot_observed_at":"2026-08-09T11:35:42.990078Z","submitted_at":"2025-02-04T18:59:46Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:41:44.453339Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2502.02589"},"observation_digest":"sha256:395b2a8a9926dc534e942634f2e4a834a461ad940a6d7fcbce5a1d76aa1cef42","observation_id":"43b09f0f-cfdd-4c8f-9c43-1143b7357f62","resolution":{"observed_at":"2026-08-09T11:41:44.453339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-08T14:25:55.743104Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.743104Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:2f6c81619ed726f741c97daf60e7255902da304ec8d08d3e2bc28c2a6b08448e","observation_id":"e5b52559-e7e7-42ee-8c3b-0be5be797755","resolution":{"observed_at":"2026-08-08T14:25:55.743104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:6dac2c4354763c18c0de927fb0a6922296ebb3b4c95cb15a132af9b1d70fbce5","observation_id":"f93e43ac-949c-4386-9124-a7ab07fdf843","resolution":{"observed_at":"2026-05-12T18:51:15.991623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-06T23:57:24.067810Z","title":"arXiv preprint arXiv:2407.08303 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:24.067810Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:7d4ea3b342c07bab1b9c7f1ccf8b128892ab768d360929c865505e3c7be52be2","observation_id":"e3aa9530-bfdd-4844-9640-dd64e7f01dc9","resolution":{"observed_at":"2026-08-06T23:57:24.067810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:4f9a64fbb400d6c77b334b1702a9a5e4ac7333c6debd414aa794a6520203eb1d","observation_id":"ea64e559-00bb-49fa-9315-8e5b1445afbb","resolution":{"observed_at":"2026-05-19T07:52:10.872328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-08-06T18:20:53.520305Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08505","last_updated":"2025-07-14T08:25:14Z","snapshot_observed_at":"2026-08-09T18:03:32.025768Z","submitted_at":"2025-07-11T11:30:57Z","title":"Efficient Deployment of Vision-Language Models on Mobile Devices: A Case Study on OnePlus 13R","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:53.520305Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2507.08505"},"observation_digest":"sha256:8f7b5bb85ffaae359c227b9ff814de4d76f0c9b0691de4c0d676f9a833d65548","observation_id":"75fc37fc-9c21-4d22-829f-a0592d761a66","resolution":{"observed_at":"2026-08-06T18:20:53.520305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:5ce40c16cc25b087ef7e6f50745d7110f7737c8bf50e54377531010def509b7c","observation_id":"736aeb7c-7f49-471f-88a5-e1ac314cf19b","resolution":{"observed_at":"2026-07-03T00:17:29.026830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.08303/citation-record","integrity":"/paper/2407.08303/integrity","json":"/paper/2407.08303/citation-record.json","paper":"/paper/2407.08303"},"outbound":[],"paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2407.08303."}