{"as_of":"2026-08-08T22:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9859c82e4389574dfc48b1cbd614147aead9b2db72252a539caff279b3ca55b8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:11.913594Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T22:49:01.206350Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T15:26:11.913594Z","title":"Benchmarking and Improv- ing Detail Image Caption, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15172","last_updated":"2025-05-21T06:42:17Z","snapshot_observed_at":"2026-08-07T15:20:37.318165Z","submitted_at":"2025-05-21T06:42:17Z","title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:11.913594Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.15172"},"observation_digest":"sha256:d789636ab72627ef5f8eb48ee3390961369e91507c62392ad14134841951d8b9","observation_id":"813805c8-f1ca-4920-bd4d-4238b150c20f","resolution":{"observed_at":"2026-08-07T15:26:11.913594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T15:16:40.200691Z","title":"Benchmarking and improving detail image caption.arXiv preprint arXiv:2405.19092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15755","last_updated":"2025-05-21T17:01:08Z","snapshot_observed_at":"2026-08-07T15:09:58.322707Z","submitted_at":"2025-05-21T17:01:08Z","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:40.200691Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.15755"},"observation_digest":"sha256:fee20d04bafa40a4c41d5d8888bab1853f838e009d4449b262bf673beb0645c3","observation_id":"60695a16-2667-4633-927a-546143c50a99","resolution":{"observed_at":"2026-08-07T15:16:40.200691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T15:15:10.933843Z","title":"Benchmarking and improving detail image caption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15816","last_updated":"2025-05-21T17:59:52Z","snapshot_observed_at":"2026-08-08T22:04:45.446242Z","submitted_at":"2025-05-21T17:59:52Z","title":"Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:10.933843Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.15816"},"observation_digest":"sha256:f7a84018b100c61cc7c389ca77b2c8a36fae93969eae6b7ce0d31072e39ae281","observation_id":"a33f1fad-b67d-4fe2-9011-183d95200ed5","resolution":{"observed_at":"2026-08-07T15:15:10.933843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T13:28:05.762074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21863","last_updated":"2025-06-02T21:33:47Z","snapshot_observed_at":"2026-08-07T13:18:38.107159Z","submitted_at":"2025-05-28T01:19:23Z","title":"GETReason: Enhancing Image Context Extraction through Hierarchical Multi-Agent Reasoning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:28:05.762074Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.21863"},"observation_digest":"sha256:3b42264582893c5bdabfa1ac2b086b2312c73c5b25a073ea98255f6efc4bd375","observation_id":"23690255-5bef-4f42-9c2d-01ee12a1f55b","resolution":{"observed_at":"2026-08-07T13:28:05.762074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T13:08:03.153714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.153714Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:96de7c9a8420b1ed5de7aedf0805778050efe50a2f5d9112dd7f863e72062c18","observation_id":"285fe182-3d78-4df4-860c-79512ddbfdd4","resolution":{"observed_at":"2026-08-07T13:08:03.153714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T05:35:07.461098Z","title":"Benchmarking and improving detail image caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07631","last_updated":"2025-06-09T10:57:26Z","snapshot_observed_at":"2026-08-07T05:26:54.977741Z","submitted_at":"2025-06-09T10:57:26Z","title":"Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:07.461098Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2506.07631"},"observation_digest":"sha256:4de06769a55587929655d1a799625cb274c7cdcf28862bbd6aeac1e7c1f2d8bf","observation_id":"93ed0f7c-a450-4603-a1d2-da3006019d51","resolution":{"observed_at":"2026-08-07T05:35:07.461098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:8159031f073cae73995813f30b940ddd65e5e4bd51c2d7663287b4922911d3cb","observation_id":"1652daa6-5db0-47f8-9260-53ec472bc50c","resolution":{"observed_at":"2026-05-19T09:12:14.524347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-06T20:53:03.136534Z","title":"Benchmarking and improving detail image caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-08T22:14:29.492090Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.136534Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:063685443366adbcb7f3eca6fbbbbfdcd9f4d44b9fdd8ad4f786e962f45537d2","observation_id":"b9a8a1c8-dff9-438b-a88b-5f5ccc91fee6","resolution":{"observed_at":"2026-08-06T20:53:03.136534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-05T22:58:34.074648Z","title":"Benchmarking and improv- ing detail image caption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.074648Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:9554a337a70a601356c34a9dae5816ead67a90695119dea07c6e0b66746bc09f","observation_id":"f4df095d-74b4-4c46-ba70-32982931c397","resolution":{"observed_at":"2026-08-05T22:58:34.074648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-05T10:38:55.536773Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03897","last_updated":"2025-09-12T05:44:35Z","snapshot_observed_at":"2026-08-08T02:19:56.866605Z","submitted_at":"2025-09-04T05:43:50Z","title":"SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T10:38:55.536773Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2509.03897"},"observation_digest":"sha256:ad9db368e58cebd6e7a36f7ca9654015a4784febf02d821efebe159ea6010512","observation_id":"7efa60df-1ec1-42e0-922b-b3e191ecf6f9","resolution":{"observed_at":"2026-08-05T10:38:55.536773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2511.21025","last_updated":"2026-04-15T22:38:59Z","snapshot_observed_at":"2026-08-02T04:56:59.957039Z","submitted_at":"2025-11-26T03:43:32Z","title":"CaptionQA: Is Your Caption as Useful as the Image Itself?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T05:42:57.288054Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2511.21025"},"observation_digest":"sha256:efc8eef5eb46b02b476d6fe9b14fe4489ac47b17e59e746b1d89cf3b50f73cea","observation_id":"57d04ba4-f38c-4f2f-aa8e-40cba7f54fb5","resolution":{"observed_at":"2026-05-17T05:44:07.252387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2604.05623","last_updated":"2026-04-07T09:27:01Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T09:27:01Z","title":"DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:29.592129Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2604.05623"},"observation_digest":"sha256:75d7762a934c5c9675b16070c2489e3872eb5dd142b3aa58f5dc3ec7ee3f3316","observation_id":"bd380b50-7238-4f25-b968-bf86e303ea03","resolution":{"observed_at":"2026-05-11T00:10:52.908202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2604.07914","last_updated":"2026-04-09T07:31:27Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T07:31:27Z","title":"Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:16:31.701345Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2604.07914"},"observation_digest":"sha256:84b136a9bb0f84dbfff0d074444e611a2e74390993a34040f635bb82d0c090ec","observation_id":"2b4fd3c9-f59f-41f6-8b87-4bb3d60f7392","resolution":{"observed_at":"2026-05-11T05:10:55.072265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2604.22855","last_updated":"2026-04-22T12:28:04Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-22T12:28:04Z","title":"Evaluating Remote Sensing Image Captions Beyond Metric Biases","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T01:06:35.604862Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2604.22855"},"observation_digest":"sha256:b2f3fd34c40c4ecdcfc33ccba2ccd02aadf63f0f9d5545b06ff4af5d652a0a01","observation_id":"95564b76-b7e8-4276-997c-26f3b7849598","resolution":{"observed_at":"2026-05-10T01:10:09.388979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-08-02T13:39:32.739295Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:c68f73dbd192eee2f00916e68612421a5307df5c7afc2d8850b314e19c9c917a","observation_id":"b52990be-c408-4fb4-abbe-760ec644682e","resolution":{"observed_at":"2026-05-11T18:46:07.565923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-02T12:36:41.415898Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:9ba173be1383dd38ea7e49553b24f31ce5318c0ecc75face2a4d22100d355677","observation_id":"15ce065b-da16-4908-a860-9868c414d8f5","resolution":{"observed_at":"2026-05-14T20:19:28.558057Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:14:59.487486Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:5e1b76daafe711345fe716ebaded3a07e355ca2e0446760234510e676bbeb0ce","observation_id":"53f6c6cc-1921-43c5-81d7-76619efc7981","resolution":{"observed_at":"2026-05-15T02:18:31.277022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T21:47:32.112057Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:f967314facbdc42026500f5ed358c3cd88e9a05c1a5c2dffdfb550436f30f765","observation_id":"a73d521d-0fd6-4a4d-aa45-aca8f4a986fb","resolution":{"observed_at":"2026-05-20T21:49:05.326127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T08:36:27.676888Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:dcbc4e8fc3d5c08e528135677509533cb1edddec1c51739fa288143ac61aa980","observation_id":"7309b0d8-e611-4360-b512-130b7e3a228f","resolution":{"observed_at":"2026-05-21T08:39:53.742970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:b4afd9c401846b5b3c43451ac972719d0099d8bafba1963919e50b63a942d8ed","observation_id":"01a168a1-f316-41bb-815b-d6fce0b9e254","resolution":{"observed_at":"2026-06-30T18:04:58.330839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.23694","last_updated":"2026-06-10T14:24:51Z","snapshot_observed_at":"2026-08-07T13:48:22.700762Z","submitted_at":"2026-05-22T14:49:48Z","title":"ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T04:13:11.756347Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.23694"},"observation_digest":"sha256:029e99d71b943b2ad820e85c658809996cadd8140d4bd49f585ba0f32d5b7f83","observation_id":"1c8fa18b-14d9-41df-b6cd-c5e96f593863","resolution":{"observed_at":"2026-05-25T04:15:20.104167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.23694","last_updated":"2026-06-10T14:24:51Z","snapshot_observed_at":"2026-08-07T13:48:22.700762Z","submitted_at":"2026-05-22T14:49:48Z","title":"ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T16:10:01.774725Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.23694"},"observation_digest":"sha256:2cf0a533d740db24f57c045eaa2173b4a8d1c9a02f5f7385a68ec819b993a15c","observation_id":"2056ba08-dead-4a32-9d61-f7822c5dc32f","resolution":{"observed_at":"2026-06-30T16:14:53.358294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2606.05702","last_updated":"2026-06-04T04:49:09Z","snapshot_observed_at":"2026-08-02T13:36:32.882557Z","submitted_at":"2026-06-04T04:49:09Z","title":"Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T01:30:36.491137Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2606.05702"},"observation_digest":"sha256:6dfbd0b3921c77be003428b91d2350d0f60d7a911eb0e8adfe9b86989a69bfa3","observation_id":"bf29fd71-c785-4c46-85ff-7997601171a5","resolution":{"observed_at":"2026-07-02T13:06:59.615769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2606.29573","last_updated":"2026-07-17T01:56:19Z","snapshot_observed_at":"2026-08-02T09:41:11.573743Z","submitted_at":"2026-06-28T19:27:59Z","title":"Reliability-Prioritized Fine-Grained Generation in Multimodal Large","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T07:13:43.265960Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2606.29573"},"observation_digest":"sha256:e21b330b35ab2bca8c16cc0bd2557f7759c2aa0a549f6f3b5fd3eb526a86a3a5","observation_id":"3f29d0d0-7245-4052-b647-458683eae725","resolution":{"observed_at":"2026-06-30T07:14:20.718552Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2606.29573","last_updated":"2026-07-17T01:56:19Z","snapshot_observed_at":"2026-08-02T09:41:11.573743Z","submitted_at":"2026-06-28T19:27:59Z","title":"Reliability-Prioritized Fine-Grained Generation in Multimodal Large","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-03T22:39:40.186814Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2606.29573"},"observation_digest":"sha256:fc188bbf0b9b6f74780a71b85fbf286750cdaa2ab2f28fe2f2d213a87fe87938","observation_id":"db0fdf84-57ac-476d-9aee-8c1109c2c26f","resolution":{"observed_at":"2026-07-03T22:49:01.212984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-02T09:41:13.256572Z","title":"InEuropean Confer- ence on Computer Vision, pages 370–387","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29573","last_updated":"2026-07-17T01:56:19Z","snapshot_observed_at":"2026-08-02T09:41:11.573743Z","submitted_at":"2026-06-28T19:27:59Z","title":"Reliability-Prioritized Fine-Grained Generation in Multimodal Large","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:41:13.256572Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2606.29573"},"observation_digest":"sha256:f8239384044d1c567559b570fced52b83ad6fabcd06d187497badb7c919728d8","observation_id":"df35cb17-457a-4714-8dcf-25e9a5cf77bc","resolution":{"observed_at":"2026-08-02T09:41:13.256572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2405.19092 (2024) 6, 20","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-08-08T07:19:59.145714Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:a894d72daf2f4bbe5264011f4d876609fc6b17c87026154a1f6b2e655423608a","observation_id":"f4e26d98-e229-4de5-8b26-f342ab24b51f","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2405.19092 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:76c048c6f714d7242082c33dc7e85c26815e60aec748252a55030ba0de18541c","observation_id":"4e184ca3-34f5-4e1a-b777-799addbfa806","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-04T04:09:49.411968Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.411968Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:abf30019320d7acec62c8632614b4f58d213edf3591e9ca8ae4981d22c9dbf31","observation_id":"3405f8cb-2315-4bf4-a71e-fe7e5c686028","resolution":{"observed_at":"2026-08-04T04:09:49.411968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.19092/citation-record","integrity":"/paper/2405.19092/integrity","json":"/paper/2405.19092/citation-record.json","paper":"/paper/2405.19092"},"outbound":[],"paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2405.19092."}