{"as_of":"2026-08-10T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a0e7285660bf0bd24f3d5f2339bf5790056ee0604d6a9e57fb8956b3ac2acdd","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:09:52.617504Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02589/citation-record","integrity":"/paper/2608.02589/integrity","json":"/paper/2608.02589/citation-record.json","paper":"/paper/2608.02589"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:52.617504Z","title":"19 Table 4: Normalized understanding and generation benchmark scores","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.617504Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:bae1a7bc37f37511f95150578f6c1c69e1e985ed3540000195cc052bfe99cd45","observation_id":"1d799694-479a-44de-ac2e-97c61fc1fa56","resolution":{"observed_at":"2026-08-04T04:09:52.617504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-04T04:09:49.214324Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.214324Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:2398530f787f9cde4a542c93dc57c16a7ad0c67f9ca1bf42521e204f7dbb853d","observation_id":"3935fad3-6107-46ce-8ffa-4315b12c3992","resolution":{"observed_at":"2026-08-04T04:09:49.214324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T04:09:49.326199Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.326199Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:87892de532d121822be555623213e121bce449d7d5c83241db65a70e62cce48c","observation_id":"3906d2c0-9003-4264-af0f-a124724ca9e9","resolution":{"observed_at":"2026-08-04T04:09:49.326199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-04T04:09:49.411968Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.411968Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:abf30019320d7acec62c8632614b4f58d213edf3591e9ca8ae4981d22c9dbf31","observation_id":"3405f8cb-2315-4bf4-a71e-fe7e5c686028","resolution":{"observed_at":"2026-08-04T04:09:49.411968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-04T04:09:49.613004Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.613004Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:a294573925c78feb886a564b960584055de23c9f6e68f4e05efa8db8671ed2a8","observation_id":"a87f0171-fe34-42dc-86dc-ead1f635dfe0","resolution":{"observed_at":"2026-08-04T04:09:49.613004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28551","snapshot_observed_at":"2026-08-04T04:09:49.764855Z","title":"Datacomp-vlm: Improved open datasets for vision-language models.arXiv preprint arXiv:2606.28551,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.764855Z"},"links":{"cited_paper":"/paper/2606.28551","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:92cf1d0719fc34e51ee179c66708c7ea0dd92ef1683a1d519b95309733755997","observation_id":"3fb70424-9216-48a8-b94d-89b097a08d86","resolution":{"observed_at":"2026-08-04T04:09:49.764855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26923","last_updated":"2026-06-25T12:00:45Z","snapshot_observed_at":"2026-08-01T15:24:38.300499Z","submitted_at":"2026-06-25T12:00:45Z","title":"GAVEL: Grounded Caption Error Verification and Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26923","snapshot_observed_at":"2026-08-04T04:09:49.932057Z","title":"Gavel: Grounded caption error verification and localiza- tion.arXiv preprint arXiv:2606.26923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.932057Z"},"links":{"cited_paper":"/paper/2606.26923","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:c24350e092e86831912d21d38db6b3eb94f49172a5ebcff4fa549cb71c72be72","observation_id":"6e22bf7f-8d30-4241-994b-3a824c549664","resolution":{"observed_at":"2026-08-04T04:09:49.932057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-04T04:09:50.080348Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models.arXiv preprint arXiv:2310.14566,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.080348Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:f472f7f0bf2859c6c733f4945b56c2061b9b880e62cca92f4359b898fdc84db6","observation_id":"12a90096-8617-4d26-b368-00fcd32d5fa1","resolution":{"observed_at":"2026-08-04T04:09:50.080348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:50.202425Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.202425Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:61db0db663bcd02af4abfce6e8ab7800aba53027c833bc32727033bb04d15b4d","observation_id":"0db60075-53c5-4cfe-a953-90b48ac25c80","resolution":{"observed_at":"2026-08-04T04:09:50.202425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-04T04:09:50.455520Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.455520Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:014efe523e20b571fdff20cd33a707184c470609a98fec6eb4a8163430572e27","observation_id":"45891aaa-9f93-4b23-9477-eb715d4018a4","resolution":{"observed_at":"2026-08-04T04:09:50.455520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-04T04:09:50.567390Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.567390Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:c21f81faa9f673142eecdb35ad4bf0cdc313b65f28e614934ea3eb8b334135fe","observation_id":"c4b31fb8-47c9-4716-b54c-af61adc38e27","resolution":{"observed_at":"2026-08-04T04:09:50.567390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15484","last_updated":"2025-07-07T05:27:08Z","snapshot_observed_at":"2026-07-06T20:10:37.385214Z","submitted_at":"2024-12-20T01:37:22Z","title":"Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15484","snapshot_observed_at":"2026-08-04T04:09:50.687652Z","title":"Toward robust hyper-detailed image captioning: A multiagent approach and dual evaluation metrics for factuality and coverage.arXiv preprint arXiv:2412.15484,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.687652Z"},"links":{"cited_paper":"/paper/2412.15484","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:2cfb4d63dc5b18f8debe119ea287508e8fbaf9ec147fe75590a272fbf78cc0fe","observation_id":"893d933d-6f00-4da1-84f3-d36db0bd92c8","resolution":{"observed_at":"2026-08-04T04:09:50.687652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-04T04:09:50.853167Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.853167Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:7599b6e2e45d3c54fe8ad1f9b1a3ce646e92f7b006c286b220f23cb7a0aa51e7","observation_id":"7e788c91-99e1-4caf-aa69-bd9a5349ba1a","resolution":{"observed_at":"2026-08-04T04:09:50.853167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26984","last_updated":"2026-06-25T12:58:54Z","snapshot_observed_at":"2026-08-06T15:58:09.419111Z","submitted_at":"2026-06-25T12:58:54Z","title":"Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26984","snapshot_observed_at":"2026-08-04T04:09:51.216578Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.216578Z"},"links":{"cited_paper":"/paper/2606.26984","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:68da865cfd2f000eaa94e7e540b4fa2e618e10dfb9bed4f7b917950957ecde4b","observation_id":"1ed8f6ab-86f3-4701-abe3-ae7d6c2326eb","resolution":{"observed_at":"2026-08-04T04:09:51.216578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:51.341587Z","title":"Accessed: 2026-07-26","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.341587Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:6e35fc08bc0ac2aa025d59b27bbaedf3f3414e8c1f6b218517058c69aaa096da","observation_id":"de52a59e-038c-49af-a0ef-08c5fbf428d4","resolution":{"observed_at":"2026-08-04T04:09:51.341587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T04:09:51.781179Z","title":"Cambrian-1: A fully open, vision- centric exploration of multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.781179Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:bf15e4d253c07ef0861fd87d6c5918f7fb1d633a9d8eb56880178800c3fc28ea","observation_id":"1cd060d6-39e7-47a5-a709-cf54e8de246e","resolution":{"observed_at":"2026-08-04T04:09:51.781179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:51.857417Z","title":"Grasp any region: Towards precise, contextual pixel understanding for multimodal llms.arXiv preprint arXiv:2510.18876, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.857417Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:7a9e4e58b6a728016831747d3345e0244d6c535a77487b0d0cff856c57677cbe","observation_id":"935f03fd-bc32-4a4f-b872-69c45a516335","resolution":{"observed_at":"2026-08-04T04:09:51.857417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11991","snapshot_observed_at":"2026-08-04T04:09:51.972270Z","title":"Vgr: Visual grounded reasoning.arXiv preprint arXiv:2506.11991, 2025d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.972270Z"},"links":{"cited_paper":"/paper/2506.11991","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:4dce907b4604f5707075e88b40df1ccdab89d07faa503a15eb79f6fedbdc5e59","observation_id":"2bef3bad-7c14-4c1b-b6d0-41b722d51922","resolution":{"observed_at":"2026-08-04T04:09:51.972270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-04T04:09:52.095666Z","title":"Internvl3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.095666Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:1692dceaf204f7940a22fddd2ca38cd086d6f1e450577d0fa8555b83a4e8c4a9","observation_id":"676ce45b-8c4e-4278-b58b-8e8fc6186f8d","resolution":{"observed_at":"2026-08-04T04:09:52.095666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T04:09:52.218566Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.218566Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:99db7f6d2a320f5bcf1d9aaf532725385313c025be02310d2b20813b0461c567","observation_id":"ab956a87-61b2-4c77-b0e1-79f09a48c5f6","resolution":{"observed_at":"2026-08-04T04:09:52.218566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T04:09:52.342656Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.342656Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:04e3c689c845b8e6b1589fe27603aa448394b707ebaa801a8c333c28aae8b54e","observation_id":"225c35c2-f0cb-40f4-9ff8-f32086799fb2","resolution":{"observed_at":"2026-08-04T04:09:52.342656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21025","last_updated":"2026-04-15T22:38:59Z","snapshot_observed_at":"2026-08-02T04:56:59.957039Z","submitted_at":"2025-11-26T03:43:32Z","title":"CaptionQA: Is Your Caption as Useful as the Image Itself?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21025","snapshot_observed_at":"2026-08-04T04:09:52.429597Z","title":"Captionqa: Is your caption as useful as the image itself?arXiv preprint arXiv:2511.21025, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.429597Z"},"links":{"cited_paper":"/paper/2511.21025","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:f21347b2eec8b8bea10c20ee250691f3e3a592383ccbf4a0134dd99c113cc194","observation_id":"89035bb5-ecf1-4149-8a0f-3d30bd5422da","resolution":{"observed_at":"2026-08-04T04:09:52.429597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-06T16:55:31.542502Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11581","snapshot_observed_at":"2026-08-04T04:09:52.487467Z","title":"Actor as its own critic: Unifying region understanding and localization via cyclegrpo.arXiv preprint arXiv:2607.11581,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.487467Z"},"links":{"cited_paper":"/paper/2607.11581","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:39a05c0b7209131c659c29ef3ca90860844508c171867980aa35efb542bfd610","observation_id":"d98d1b9c-efa6-44e1-beb6-f1e6ceb109eb","resolution":{"observed_at":"2026-08-04T04:09:52.487467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13123","last_updated":"2025-05-17T06:50:58Z","snapshot_observed_at":"2026-08-07T16:01:22.644863Z","submitted_at":"2025-04-17T17:40:06Z","title":"Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13123","snapshot_observed_at":"2026-08-04T04:09:52.550837Z","title":"Low-hallucination synthetic captions for large-scale vision-language model pre-training.arXiv preprint arXiv:2504.13123,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:52.550837Z"},"links":{"cited_paper":"/paper/2504.13123","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:1b52faee71ccdc898933ef7c28c46839de7157b2d4fcde1d64826e577a65703d","observation_id":"3a734a36-931b-4707-b5bf-109b8efadd8c","resolution":{"observed_at":"2026-08-04T04:09:52.550837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:51.455472Z","title":"Aloha: A new measure for hallucination in captioning models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.455472Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:4d9ae478eba007b51aa9968788caa182da5119d41d9572248b2d4f440cecfc6b","observation_id":"6acf51c1-8315-4717-9c22-00ed4c529ebe","resolution":{"observed_at":"2026-08-04T04:09:51.455472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-04T04:09:50.353673Z","title":"Glm-4.5 v and glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning.arXiv preprint arXiv:2507.01006,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:50.353673Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:fa34f10bc0f47cf869f73ddeb090e24af60d2ff3595bef4bca39428d652e48e9","observation_id":"cdc5b4cf-ae0f-4aa0-a13a-72f89c33a572","resolution":{"observed_at":"2026-08-04T04:09:50.353673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:49.263896Z","title":"Caparena: Benchmarking and analyzing detailed image captioning in the llm era","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.263896Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:e0195c21c4f0a2494a2359296bc633c25c17ea7b8b9553575d281b4f025320be","observation_id":"53469e09-0e28-4021-aacc-7be29cebff5f","resolution":{"observed_at":"2026-08-04T04:09:49.263896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-04T04:09:51.542639Z","title":"Longcat-image technical report.arXiv preprint arXiv:2512.07584,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.542639Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:eb6302bb70f2990b38b1a070c85ac524127e8e4eab68e9bcf075ca825aa892b3","observation_id":"446143d6-f499-4551-b330-86af913451f2","resolution":{"observed_at":"2026-08-04T04:09:51.542639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-04T04:09:49.012960Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.012960Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:3f50f5f2dec8debdaa7b4585ce67bf4ecc110a8dfc1fb8452646598c2bb03e3e","observation_id":"36e6ca72-5551-497d-9d24-a924091063ad","resolution":{"observed_at":"2026-08-04T04:09:49.012960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-04T04:09:49.178595Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.178595Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:494b00a8540035cef0b8def3d44cd2cf69de960e919eb8c1581a5ddfe1fda653","observation_id":"4c72255b-dd99-4530-908c-e847c85a552b","resolution":{"observed_at":"2026-08-04T04:09:49.178595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-04T04:09:48.916885Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:48.916885Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:1eafc3512c71ab2cb101a1d5ac1dbce176c285eedd31563f2f5ac1e328485f54","observation_id":"6736a50e-288a-4389-bdf0-5818b74812f8","resolution":{"observed_at":"2026-08-04T04:09:48.916885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T04:09:49.068148Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.068148Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:d55555397bd808893e2f57e1da296aad6befb617adf11d5fbc4bd42aec706861","observation_id":"47486a42-f38a-45fc-9a4b-b1aec395b30b","resolution":{"observed_at":"2026-08-04T04:09:49.068148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:09:51.136197Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.136197Z"},"links":{"citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:8291e61d5d3c48060df861754ab8152793b16ae69a5c0bd2177cfe5bcf289f9b","observation_id":"4e90874d-8934-4c6e-ab7f-c67569e93003","resolution":{"observed_at":"2026-08-04T04:09:51.136197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:31:36.624827Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.02589."}