{"as_of":"2026-08-24T04:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec00c2add049f3bf56e2fbf208764f1b5dcca92e9e47e37619d1f8a698e99566","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:52:51.080297Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11074/citation-record","integrity":"/paper/2608.11074/integrity","json":"/paper/2608.11074/citation-record.json","paper":"/paper/2608.11074"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T10:52:50.787841Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.787841Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:c374ea12eaba692e9d772bd4b78facaa789e2e67a73bb20ff6f854bf5dcd9a2f","observation_id":"fb823829-1f21-46f5-88fd-b8f41034e29a","resolution":{"observed_at":"2026-08-12T10:52:50.787841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.144703Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":"c079c448-b238-413b-bb0d-77cdf5d45a0c","year":2019},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.796561Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:31037f28ae810de3ebec761ce432eeb29e02da19e89ad57b5744591cc68e0182","observation_id":"22c684da-e563-4c0c-b94f-a7f2a2e240cd","resolution":{"observed_at":"2026-08-12T10:52:52.149360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.130168Z","title":"Introducing Qwen3.5.https:// qwen.ai/blog?id=qwen3.5, 2026","venue":null,"work_id":"5bf6a3a7-8e98-4761-9ffe-fe1f5fe4bd78","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.801257Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:7272d2b4380ac9e31c66207b3e3ace9cf94c577194365f201e7f1cc42c5a5c52","observation_id":"6e061977-c34d-4e46-b188-37e0058f3497","resolution":{"observed_at":"2026-08-12T10:52:52.135111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.115249Z","title":"Introducing Qwen3.7-Plus.https: //qwen.ai/blog?id=qwen3.7-plus, 2026","venue":null,"work_id":"8065e7a7-55d2-4f6d-b937-e5e97225f651","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.806176Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:db4be2360581c5990bad488919667a9af52602d841656d8d3301cbc8e02355d2","observation_id":"10341f9d-452f-43db-bb0d-934fda7b16af","resolution":{"observed_at":"2026-08-12T10:52:52.119865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.100885Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"43e885c3-3acf-4214-aa79-ad39e330fe6b","year":2016},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.810848Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:b3a4f555806f62aecd74272c00d637a612fa26d810513d60bfc3d0985ae6566e","observation_id":"ca6037cf-610c-4c8d-84ad-fe7349a80727","resolution":{"observed_at":"2026-08-12T10:52:52.105506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.084538Z","title":"Introducing Claude 4.8 Opus.https://www","venue":null,"work_id":"b45dd35a-50a4-42c1-81ec-d0c7f934e49f","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.815513Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:8a3ac650a0e4f4de50c65be11978653eaeb8878aae7c79631506a53c4ad49cfa","observation_id":"a2c58138-d414-4311-bca2-12a02ee3e5af","resolution":{"observed_at":"2026-08-12T10:52:52.089992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.069434Z","title":"Introducing Claude 5 Sonnet.https://www","venue":null,"work_id":"60398383-3548-41d8-91f0-555bf3a2ae6f","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.820076Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:b21b7a83b4458b74db3d5aba1c33c2afb14e54ceea47f21372b45002b9d368c3","observation_id":"87f3132f-49e6-4260-ad4d-1910cdbd0a8c","resolution":{"observed_at":"2026-08-12T10:52:52.073991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-12T10:52:50.825096Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.825096Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:82dab55753e5ac63b0b7af25b1085e540624541d4eff18284cb1ef9a8dbf4288","observation_id":"10b6c1b8-bb8b-4b50-892e-3ea7ae7a9505","resolution":{"observed_at":"2026-08-12T10:52:50.825096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.055147Z","title":"METEOR: An auto- matic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"fb4210d6-0512-46ae-a6e6-448e6101ec74","year":2005},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.829901Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:f2c0604f3b613163a40885588068451900482df605c2172a33eda317ebeaca01","observation_id":"fe604e3a-a988-4434-9038-668068b36227","resolution":{"observed_at":"2026-08-12T10:52:52.059812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.041011Z","title":"Improving image generation with better captions","venue":null,"work_id":"c219eeff-9b6d-4ba8-8328-4bf153c9e087","year":2023},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.834411Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:4d4ace13be2963df8adb3e8b2fd042b2cde1b4d5ba2008cd83d806c4a4a8dca0","observation_id":"edfacc98-fea9-46e1-889d-8cf3ae14a668","resolution":{"observed_at":"2026-08-12T10:52:52.045605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-12T10:52:50.839047Z","title":"Sam 3: Segment anything with concepts.arXiv preprint arXiv:2511.16719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.839047Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:75501570e23b734c0e18d34009bf559b492793c148013e4a8e56e9cd17cb85b1","observation_id":"bd2c4123-99e8-479b-9821-1ab9b7eb877e","resolution":{"observed_at":"2026-08-12T10:52:50.839047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.024674Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"f0417be9-ace4-440b-b85d-0bf771621914","year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.843985Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:6a54750b9f2d5924ba34c32c64a7a6230e33115264ecd3055287bb8485130860","observation_id":"8e898339-e4c0-4cbf-871a-19a6272aadbc","resolution":{"observed_at":"2026-08-12T10:52:52.030769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T10:52:50.848522Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.848522Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:f73a48c11357d862354e40cf313f6194576e89cdde4609c846c4242b94644c59","observation_id":"2bc2570f-4f2a-473c-a4b5-47f28b23849f","resolution":{"observed_at":"2026-08-12T10:52:50.848522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.009092Z","title":"Caparena: Benchmarking and analyzing detailed image captioning in the llm era","venue":null,"work_id":"3e170447-2379-4bf5-b4b5-639cbc8e61c2","year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.853309Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:561f9d00c86739f26114f9242ae141281ceeb233ace0e2ea566491dc5e3a55a3","observation_id":"66ecfa82-8de1-41d9-9daa-037ace047ce3","resolution":{"observed_at":"2026-08-12T10:52:52.013814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.858735Z","title":"Probabilistic embeddings for cross-modal retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.858735Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:7ddb926a1f8c41f092ae1bc3b2fd7e77426a70e48815758aef9b537734f1571a","observation_id":"3892b1af-b0f5-4f9d-94de-86c4438bf51e","resolution":{"observed_at":"2026-08-12T10:52:50.858735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-08-20T01:13:22.133159Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-12T10:52:50.863189Z","title":"Benchmarking and improv- ing detail image caption.arXiv preprint arXiv:2405.19092,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.863189Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:92aa8d9b4ab81c1c7122313c430436d501db3648900bc7778d795e9e4deacc4f","observation_id":"f6c249fb-f688-4567-b001-6c6e6bddf1ae","resolution":{"observed_at":"2026-08-12T10:52:50.863189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.983658Z","title":"Caponimage: Context-driven dense-captioning on image","venue":null,"work_id":"86aed16d-48b3-4e24-bfcc-4cac5edf676f","year":2022},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.867920Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:72572201177386f2b272dc6f94a24ea3380297f7b0bc971862277ac2ca43c327","observation_id":"06e094b6-4fca-43f2-a84b-cbec7f1e8829","resolution":{"observed_at":"2026-08-12T10:52:51.989087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.967721Z","title":"Gemini 3.1 pro: A smarter model for your most complex tasks.https://blog.google/ innovation - and - ai / models - and - research / gemini-models/gemini-3-1-pro/, 2026","venue":null,"work_id":"531fcbcf-f4f7-480d-be8c-011cb4c76433","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.872464Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:29c11521f09d2439874dac05f31bb519c9bdc84ea4eda53d7c3379ff518836a2","observation_id":"614d9046-cbe1-40b3-bba3-c01e53ba54a0","resolution":{"observed_at":"2026-08-12T10:52:51.972725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T10:52:50.876964Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.876964Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:1672b59eaabbf790178999a3daf5b3aa1e20b22753804bbe243f56a36dd0770c","observation_id":"8ad105b4-5cfd-4f4d-b931-3fd5a5a0753f","resolution":{"observed_at":"2026-08-12T10:52:50.876964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.951525Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"b5649ccb-dfd7-47e6-8b6b-2e290ef3ad94","year":2019},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.881867Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:29c915f4029701ba012193398bd734e6ccb10133f00333911e77bd38fe44087f","observation_id":"bb0459c9-ad98-43ae-ad5f-447880af2d24","resolution":{"observed_at":"2026-08-12T10:52:51.956603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.886164Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.886164Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:3d2b093f271552cd34a1720f47532f22091394775a66c1f5728b36f9a58b38e1","observation_id":"63c1495b-ff17-46c2-9a7d-8d36fd6fa924","resolution":{"observed_at":"2026-08-12T10:52:50.886164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.923324Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"9fc53f2b-e715-4194-a9bc-9bd08d2c9dab","year":2021},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.890941Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:ee8e877165aa931d223df239d71765652751444958905e16aede4cce4abc0250","observation_id":"ccbb5663-0755-4698-82bf-0a88b475d55d","resolution":{"observed_at":"2026-08-12T10:52:51.928099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T10:52:50.895330Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.895330Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:2dc31ac322c1cb780d3d7ae5a09b6718d7926d3c424af28a647b9e2c30ff9499","observation_id":"b5ee2265-de97-4ea4-aaf5-59e8e1d7911b","resolution":{"observed_at":"2026-08-12T10:52:50.895330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03748","last_updated":"2026-06-02T15:01:13Z","snapshot_observed_at":"2026-08-07T08:37:57.358483Z","submitted_at":"2026-06-02T15:01:13Z","title":"Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03748","snapshot_observed_at":"2026-08-12T10:52:50.900071Z","title":"Ultralytics yolo26: Unified real-time end-to-end vision models.arXiv preprint arXiv:2606.03748, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.900071Z"},"links":{"cited_paper":"/paper/2606.03748","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:c45dba588255af6847600b4dabef10d6713c2debfba765011e9c6243037d0c4b","observation_id":"18cde2de-648d-4b74-a01d-a825ae005dab","resolution":{"observed_at":"2026-08-12T10:52:50.900071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.905999Z","title":"Densecap: Fully convolutional localization networks for dense caption- ing","venue":null,"work_id":"33ed9fb2-1e27-42ab-a983-67bb85a8698d","year":2016},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.904656Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:5e36bd01ec952d123ce3245ce16129eb0635c019e296a6ade606d6ea043ca543","observation_id":"c5566fef-f324-47ee-9648-53d8379abe58","resolution":{"observed_at":"2026-08-12T10:52:51.912263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.889464Z","title":null,"venue":null,"work_id":"96c666b3-249a-4213-864f-fb2c2e929afe","year":1956},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.909046Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:0d97387967831291823c10f7a5d348dded8b30999a5a4aafb8644f2e6a51442f","observation_id":"c3e5a9fd-26b1-4ca2-aaf6-303e5a4cb20e","resolution":{"observed_at":"2026-08-12T10:52:51.894428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-12T10:52:50.914242Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world.arXiv preprint arXiv:2506.24102,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.914242Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:400b8e8642701b2e0d0e3f5c22ce39d1286f2fbca90c5e7827447a43384dff56","observation_id":"08ef701c-714a-4f5b-ae1e-6708a30a4cab","resolution":{"observed_at":"2026-08-12T10:52:50.914242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.873751Z","title":"Evaluating object hallucination in large vision- language models","venue":null,"work_id":"51443408-70fa-4419-9d2d-77c70755e0dd","year":2023},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.920123Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:95d9d92ffed916e17b37864f66fc6bd71ab47de3f328fd24fd84479c3af01755","observation_id":"0c4914dc-2ac3-41f2-b682-6a1c38a2b201","resolution":{"observed_at":"2026-08-12T10:52:51.878865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.856426Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":"0706bb98-8083-4a2e-9807-9fb814bdd928","year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.924723Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:d887cfac8955ebf23fd4e2dc7830e6b37801edac257df54618007d27958429e6","observation_id":"5471df5c-4023-4deb-9f6f-3d7d2fd4f774","resolution":{"observed_at":"2026-08-12T10:52:51.861865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.929003Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.929003Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:872872e4649b34f584bf27a74b27601c119dd1f08fb21204e330ce3b3264610b","observation_id":"ef83848c-e190-40fd-8578-c3d20361216a","resolution":{"observed_at":"2026-08-12T10:52:50.929003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.826607Z","title":"Capability: A comprehensive visual caption benchmark for evaluating both correctness and thoroughness.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":"7ab98b22-127e-453a-8450-cff0aaa9ffe1","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.933350Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:09fbe65a33c594016f3c916725a1ee30724ee2b4cc3f3732aa7d22f198ed492c","observation_id":"463a2f4a-6ebf-4d48-b514-17739c437d6e","resolution":{"observed_at":"2026-08-12T10:52:51.832308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.808169Z","title":"Benchmarking large vision-language models via directed scene graph for comprehensive image captioning","venue":null,"work_id":"996c5c5c-9917-4147-9c20-2a5073fb32da","year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.938256Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:645e20c87691c5e8147748b0c8271b55d4033cbd8fe3bb322a9e74c9f5830f07","observation_id":"d63f7896-5d34-486a-b1f1-a70ba4cfe167","resolution":{"observed_at":"2026-08-12T10:52:51.814862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.791513Z","title":"Tiktoken: A fast bpe tokeniser for use with openai’s models, 2025","venue":null,"work_id":"9dfb4aa9-e652-4f67-9241-ba5211259e0d","year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.942941Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:afb71ae401a01cc48626b6eb6dc8b77ce3b31a39bc32105f87263e2b6c990e18","observation_id":"71152518-d0d9-4a43-8ad5-32090912b71f","resolution":{"observed_at":"2026-08-12T10:52:51.796510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.776030Z","title":"Introducing GPT-5.5.https://openai.com/ index/introducing-gpt-5-5/, 2026","venue":null,"work_id":"4b272d6d-bf0a-4f98-8625-40829adfccfa","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.947265Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:d3bcdc9f3a2632926c33a46e31271117d497ba5a18be57a647d97b437d6cde0e","observation_id":"941478e9-2896-487f-9fb4-71d671570938","resolution":{"observed_at":"2026-08-12T10:52:51.780946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.759772Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"b0193ac2-4a3a-4b7d-b822-e352d1993367","year":2002},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.951686Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:9f2dc69b09c4c54af7176df11b2d0059e6b3c96260b127e66264e802b997f60d","observation_id":"c34e1d97-2c40-4d09-b61d-c5398be36015","resolution":{"observed_at":"2026-08-12T10:52:51.764776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.956126Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.956126Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:a846ea9c261b6ee66ef6e4e0ed056c4015cadbdbc9cbb52a5a726ed86c234e79","observation_id":"3a36687d-027c-42ba-9cdf-e57e8a4c1f22","resolution":{"observed_at":"2026-08-12T10:52:50.956126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-12T10:52:50.960311Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.960311Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:244d01362c19bcc2490161316000549d0c8ae3eecc2f0decaa94cfef804235ce","observation_id":"0abb0a37-9e05-49f3-9f30-f3d168c57684","resolution":{"observed_at":"2026-08-12T10:52:50.960311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:52:50.966282Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.966282Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:11a7d86f9abbc0585aecd2d268aff0cfe4f2cfa7911afde9ac70a7cafccd6a4f","observation_id":"a26dfb02-268a-4d3b-b099-e00709167faf","resolution":{"observed_at":"2026-08-12T10:52:50.966282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.971425Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.971425Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:397e051211cd3271a6f07adf363f5003fd9a31674a333bd214d423026eedb7a8","observation_id":"bdbd1a0f-2326-46ba-88c7-b0c4ef7633d1","resolution":{"observed_at":"2026-08-12T10:52:50.971425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.723201Z","title":"Mitigating fine-grained hallucination by fine- tuning large vision-language models with caption rewrites","venue":null,"work_id":"de0a80cb-7a12-4941-9cac-413f99464ae6","year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.975981Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:7f59e0f5d0c5494ed86275052d3191cf9c03812aa09106d5c3145261dbb0d702","observation_id":"8413b54b-45a5-4218-9811-bbda9f10af53","resolution":{"observed_at":"2026-08-12T10:52:51.728283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.708392Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":"ad3eebc7-45b6-48a1-9441-808d519e0738","year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.981459Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:b19933e9053f67d22ee1d62ffb564b261e2b7a14080b2390321b3b2c6d040cdd","observation_id":"361721fe-0e60-4e33-a77f-534259e12ab7","resolution":{"observed_at":"2026-08-12T10:52:51.713308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.692995Z","title":"Grit: A gener- ative region-to-text transformer for object understanding","venue":null,"work_id":"840d6f95-24a8-4166-b0e6-6d16ce6ae6e3","year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.986777Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:654c6b0acc49ee9dbbdd7b858059460c844edf7aad79a766ceb0c5da77f73ebf","observation_id":"115e3897-da30-47da-b3bc-1cd741aa6b1e","resolution":{"observed_at":"2026-08-12T10:52:51.698309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.991455Z","title":"Caprl: Stimulating dense image caption capabilities via reinforcement learning.arXiv preprint arXiv:2509.22647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.991455Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:bb0f04c2208459945d218c4764f61631966b1b0431c6491df2dcdf7fb8133ba9","observation_id":"9942a02c-6c61-4ae1-a7a2-9aa279b68c11","resolution":{"observed_at":"2026-08-12T10:52:50.991455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T10:52:50.995951Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.995951Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:650d7151e5d70fdaf04be39a7c7312e7a57446ffd9b21e19e12a1a85a130faa0","observation_id":"284a5143-6864-4bd3-8048-c86555f34307","resolution":{"observed_at":"2026-08-12T10:52:50.995951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.677417Z","title":"Cap- tionqa: Is your caption as useful as the image itself? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 23741–23750, 2026","venue":null,"work_id":"05029cce-dbd1-41e4-a68e-0f70ef2af79e","year":2026},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.000591Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:d9a61f320ba1b92b3f0bd0211b8bf0ed083605f86aee093102147fe9bbf8c567","observation_id":"e8f7bbbf-bd8f-47ec-bba3-89082c558477","resolution":{"observed_at":"2026-08-12T10:52:51.683143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.660599Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":"8133eee7-77ac-4bf1-b3ff-c5a683d1e4e8","year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.005588Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:c97677dc6b8417cf0fd23078f46c555500978c3b5c171440dcc383dc1a48fa7d","observation_id":"092b2168-da85-414e-8028-79404d2fe90a","resolution":{"observed_at":"2026-08-12T10:52:51.666664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.646084Z","title":null,"venue":null,"work_id":"dc7baa30-530a-42d9-adaf-931ad8961f88","year":2014},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.010364Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:06eac6061b714071c6c819a5a9cc65f365eae1d49369073216d1be8ef55c5b1b","observation_id":"43d3e77e-e753-433c-b720-5c705de9e5fa","resolution":{"observed_at":"2026-08-12T10:52:51.650753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.631553Z","title":"Wein- berger, and Yoav Artzi","venue":null,"work_id":"4ef38f34-a143-4590-ac93-06d64c3ffc9d","year":2020},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.015024Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:5f3e9d3b487c68422ed5ce40632dc31a55a69ac7537d046f7c91b1f3c11456fc","observation_id":"f7c26d60-5375-423e-841a-d6959ade3a81","resolution":{"observed_at":"2026-08-12T10:52:51.636349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-20T02:29:37.867282Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-12T10:52:51.019471Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.019471Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:14543af1b789300ea6dc286db6293f89758b3253205905702ad5238bf6eeaf51","observation_id":"80997912-775a-44e6-8a5c-6f81061a05d3","resolution":{"observed_at":"2026-08-12T10:52:51.019471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.616214Z","title":"Dreamlip: Language- image pre-training with long captions","venue":null,"work_id":"bbc15453-90d5-43f8-888b-85038e67c5cf","year":2024},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.024236Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:075be7e34ef6883fff6d05f716abdb68b12ed48f29393baf6d1bd31a51b99481","observation_id":"f9e969d4-9295-41a1-ae35-7dafedd33daa","resolution":{"observed_at":"2026-08-12T10:52:51.621776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.601513Z","title":"full-scene","venue":null,"work_id":"45beb566-b02c-4bb7-bf9b-20d7a23afbb7","year":2017},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.029166Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:93679a2b4f1b73e35d4cd490f424651f4f8fb038179387815579407b93557cb4","observation_id":"5e613948-0d9a-47e8-9e71-8a10acd3b89a","resolution":{"observed_at":"2026-08-12T10:52:51.606136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.526821Z","title":null,"venue":null,"work_id":"c8203dc7-4584-446f-b558-85d43e2fe3c7","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.054562Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:569247db543b2e904e659ab0048f98f93c1ee0ad5cb03b11af795793c57f9189","observation_id":"9b48ed4d-7e31-4047-bf4c-1ea6848f57cd","resolution":{"observed_at":"2026-08-12T10:52:51.531982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.543078Z","title":null,"venue":null,"work_id":"1ef240cc-6126-4ed8-958e-5f5d8a1e8123","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.049712Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:f89e1369a43f8f0bf03becacb4ea3f9431626dabf0bb1fb61da1b857281d73db","observation_id":"549a85d1-4e64-4ba0-a64b-c5ad7906e6a6","resolution":{"observed_at":"2026-08-12T10:52:51.547776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.510266Z","title":"7 8Task: 9Generate the MAXIMUM possible number of QA pairs","venue":null,"work_id":"c801c786-71c5-4335-9f9e-5a9467e49133","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.059553Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:97e8dc5d8509a380a58fa20f7d6f770d10f41f8d5c7aafa2077c6d4cae952816","observation_id":"c7b2f394-a591-4da4-a6e4-038498c8da95","resolution":{"observed_at":"2026-08-12T10:52:51.515248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.444962Z","title":"object_id","venue":null,"work_id":"567d41b7-bc93-4b25-97b9-2b35efe883c6","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.080297Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:bc5d49a12b6805377e68b4d02634ef34b16fa1e5ab4a9c37cdfb57f1a579b9e3","observation_id":"d2f856ca-653c-41f0-83cf-cd4c26a573a1","resolution":{"observed_at":"2026-08-12T10:52:51.452534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.587103Z","title":"Do not hallucinate","venue":null,"work_id":"45f57c18-e004-44cd-b135-75bbadd466e0","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.034304Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:b392f76eef4ef144aafbd4fdd669ccf86856ad6bee10560cf1485d97f0082f34","observation_id":"0276021e-2f88-4a74-966b-34e75bc58508","resolution":{"observed_at":"2026-08-12T10:52:51.591659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.572657Z","title":null,"venue":null,"work_id":"aac46739-2d6b-4c2d-894c-c9f439c68329","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.040224Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:c2fcb15901496449e244cf012904bf404d3d366927c42bfde8404bc657ac70ba","observation_id":"8f36c795-134c-470f-b722-9949a081ba76","resolution":{"observed_at":"2026-08-12T10:52:51.577338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.557490Z","title":"spatial_and_localization","venue":null,"work_id":"6bbdaa47-d946-4766-9b52-7a79a1a90bea","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.044834Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:6f3c3e90393fa2b27aac9c0cf91b23e23d4b1b0f3781cb4daf4592e04be984a4","observation_id":"e4e5e57a-3cd5-49ef-ac2a-7be27d9eaa87","resolution":{"observed_at":"2026-08-12T10:52:51.562839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.495074Z","title":"the dog,","venue":null,"work_id":"1327b473-786a-4c86-b8be-efb29472921b","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.064771Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:b317452584e4113b5b72860e2b37cbb1a3f677004af018e77817d0d314f0a532","observation_id":"0ce8dab3-aaaf-4827-84a2-e9c7b253b92e","resolution":{"observed_at":"2026-08-12T10:52:51.499720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.479685Z","title":"Natural Look","venue":null,"work_id":"f80e5d7b-f3c4-4f5f-9918-2b7407a72016","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":212,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.069844Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:d167db2dd982d1df68cf66970fbb50cefae12077240f1935ffdff89151e29a3a","observation_id":"99f15aa7-1387-4680-b7dd-9094fcf98f68","resolution":{"observed_at":"2026-08-12T10:52:51.484108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.463348Z","title":"How many white patches are on the neck of the Bulldog","venue":null,"work_id":"0c9d96f0-318c-4274-b4e9-bf5dfd3ebaee","year":null},"citing_paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering","version":1},"reference_index":263,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.075472Z"},"links":{"citing_paper":"/paper/2608.11074"},"observation_digest":"sha256:82c3fc1bf06d7da9ba631259fd9992a8a5a3dd43d624aad5bc8c61d549fc644a","observation_id":"2852b140-43d5-46c6-a010-c178194c71cb","resolution":{"observed_at":"2026-08-12T10:52:51.468940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11074","last_updated":"2026-08-11T15:36:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T01:13:34.917400Z","submitted_at":"2026-08-11T15:36:10Z","title":"CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2608.11074."}