{"as_of":"2026-08-10T12:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a0de91898c09882a1f4c89b41462f177fa8c77e9f70f7c1a402236711319a91","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:41:44.532731Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:23:28.438005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:028b7e5ff2149c3f8135c4734456c3845494795d8fcfa0348530bbfa19d24a9d","observation_id":"d15b7e7e-f44d-4dd6-9422-b149b8c24e0a","resolution":{"observed_at":"2026-05-15T22:09:16.246786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:c2059b4e83ed91e3679838d2039df701ed20f380875f9423e2fabca1e0767c4f","observation_id":"fdf7a16c-0e59-4fc1-91d5-130f6ccbcf13","resolution":{"observed_at":"2026-05-11T10:09:25.282416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-09T11:41:44.532731Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02589","last_updated":"2025-02-04T18:59:46Z","snapshot_observed_at":"2026-08-10T02:31:27.027113Z","submitted_at":"2025-02-04T18:59:46Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T11:41:44.532731Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2502.02589"},"observation_digest":"sha256:ceabd4d2de2c2385651f376678a9929594ce09dc1b304a19073ec15c3f9606db","observation_id":"0d768d3b-8d18-42c7-bbc8-72919175e8b8","resolution":{"observed_at":"2026-08-09T11:41:44.532731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:2a2fb263c2980c1968c1b95620675f831bafa892f75180c5cb49f7673c3fc73e","observation_id":"3e95b839-3773-4b95-99c6-bf0a01e15116","resolution":{"observed_at":"2026-05-22T19:52:01.832523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-07T13:09:56.862819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:56.862819Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:9cac112f2b2affdfc1af13b6cf1623c83300330016e85b488148e92df443cec6","observation_id":"8f4a2872-484e-4da9-85af-e0d56c56e405","resolution":{"observed_at":"2026-08-07T13:09:56.862819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-07T12:58:48.258130Z","title":"In Proceedings of the Seventh Conference on Machine Translation (WMT) , pages 578–585, Abu Dhabi, United Arab Emirates (Hybrid)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23078","last_updated":"2025-05-29T04:34:04Z","snapshot_observed_at":"2026-08-07T12:51:29.093571Z","submitted_at":"2025-05-29T04:34:04Z","title":"Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal Transport","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:48.258130Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2505.23078"},"observation_digest":"sha256:dfc7b220364005ef63445ea343f436e54c52f027b700747f777504a977446ff4","observation_id":"2cc224ce-97fb-4208-a204-b9c5ec103c97","resolution":{"observed_at":"2026-08-07T12:58:48.258130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T21:52:24.893267Z","title":"From pixels to prose: A large dataset of dense image captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.893267Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:ae2fe6b2ce316ceef36d0c1097db6ee5ea6eccaf34933819b2b0764bc69f96fc","observation_id":"4aaaa547-1faf-4365-b5ba-e27ee147e874","resolution":{"observed_at":"2026-08-06T21:52:24.893267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T19:06:03.980611Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06654","last_updated":"2025-07-09T08:38:46Z","snapshot_observed_at":"2026-08-06T18:55:30.402813Z","submitted_at":"2025-07-09T08:38:46Z","title":"MS-DPPs: Multi-Source Determinantal Point Processes for Contextual Diversity Refinement of Composite Attributes in Text to Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:03.980611Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2507.06654"},"observation_digest":"sha256:fd6d481060d8995731f77f5b251b6b52e8cc5e38b4afec823eca11360b1502bd","observation_id":"becd85ce-93b1-4790-9592-8da2c45b33fb","resolution":{"observed_at":"2026-08-06T19:06:03.980611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T05:59:15.603444Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-07T09:44:40.622513Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.603444Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7dcf34c823412295fefc3aaadeb4c24f56156d724f19ced004c0da0bb7c0e9c1","observation_id":"ce87387f-6774-4174-adf5-76bfa3e64914","resolution":{"observed_at":"2026-08-06T05:59:15.603444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-05T10:19:54.462627Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-10T04:42:03.007150Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.462627Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:5d551206f105375ca061b4efa9344559962ecddad7769056ddbe69451b186888","observation_id":"93220cf9-883b-4f79-8d90-b1cfa87f3d93","resolution":{"observed_at":"2026-08-05T10:19:54.462627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-04T18:48:03.803853Z","title":"From pixels to prose: A large dataset of dense image captions.arXiv preprint arXiv:2406.10328, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.803853Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:4aa5b0635eca543f5b09970f65eee32928e64dcf6d4f054b278fe09efbfcd830","observation_id":"a40919a6-6724-4fa7-b093-3f5f9d14a557","resolution":{"observed_at":"2026-08-04T18:48:03.803853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-06T04:43:08.432770Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:b522588572912d495b389028e511544064e83035d32597140a5ce47e21f1fcee","observation_id":"1e3a1767-f545-4f45-b653-e5e7622b1d96","resolution":{"observed_at":"2026-05-20T12:08:15.863682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2605.21728","last_updated":"2026-05-20T20:43:38Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T20:43:38Z","title":"BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:01:24.453821Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2605.21728"},"observation_digest":"sha256:8772946c547a12e5b73a3c0a1a6113a1014d5ea82025fdafc3707a152bd73973","observation_id":"6fb820e6-d82a-455e-ac0b-fcf50011016b","resolution":{"observed_at":"2026-05-22T09:04:45.988241Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":"2406.10328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-06-29T13:23:28.438005Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":"aeacb482-3a4d-4073-865a-d41ff1e7d1d3","year":2024},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:22998b9b7de53fe2272efe7b8c85959a8abe93b02bbc08fbbfefccb7b2fefe56","observation_id":"9416758b-e8e1-4ecd-9f1b-7af77abf22f4","resolution":{"observed_at":"2026-06-29T13:23:28.439444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-02T06:14:02.725335Z","title":"From pixels to prose: A large dataset of dense image captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:02.725335Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:567646a5bc2d229ab94e5f6f8c641ca3f461b623c82c8519fde979f99bc6b9ad","observation_id":"f2f6443d-f7f4-4dff-bcb1-acd6bcf3d080","resolution":{"observed_at":"2026-08-02T06:14:02.725335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-05T00:49:46.472687Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00868","last_updated":"2026-08-04T07:47:28Z","snapshot_observed_at":"2026-08-10T11:21:40.288011Z","submitted_at":"2026-08-01T21:06:17Z","title":"MIDAL: A Dataset of Math Image Descriptions for Accessible Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T00:49:46.472687Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2608.00868"},"observation_digest":"sha256:c69e93947aeb3dbc89f14b6e0b443f99a55b52bf2f86dc5fad43cd46a5128057","observation_id":"99b7a9c9-e0ce-4fd2-9a40-4f126a3beb0d","resolution":{"observed_at":"2026-08-05T00:49:46.472687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10328/citation-record","integrity":"/paper/2406.10328/integrity","json":"/paper/2406.10328/citation-record.json","paper":"/paper/2406.10328"},"outbound":[],"paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2406.10328."}