{"as_of":"2026-08-15T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81867fec365352b973b310d7e188a7f5f459880b9c3e6253381585ef2b2ae75e","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:35:48.056317Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:15.313911Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:26:16.116871Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"cited_work":{"arxiv_id":"2411.19106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19106","snapshot_observed_at":"2026-08-07T15:26:16.116871Z","title":"Detailed Object Description with Controllable Dimensions","venue":"cs.CV","work_id":"8daba5e7-8bde-4654-abb5-d3ec59245ad4","year":2024},"citing_paper":{"arxiv_id":"2505.15172","last_updated":"2025-05-21T06:42:17Z","snapshot_observed_at":"2026-08-13T01:45:46.110293Z","submitted_at":"2025-05-21T06:42:17Z","title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:15.313911Z"},"links":{"cited_paper":"/paper/2411.19106","citing_paper":"/paper/2505.15172"},"observation_digest":"sha256:5bc75b1d8158a3af6316b01af513e506cc7a06edd1c0200fd25606c6b78335c3","observation_id":"144dfe14-17ee-4373-af5d-381632a1b5ca","resolution":{"observed_at":"2026-08-07T15:26:16.179513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19106/citation-record","integrity":"/paper/2411.19106/integrity","json":"/paper/2411.19106/citation-record.json","paper":"/paper/2411.19106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.680852Z","title":"Describing objects by their attributes,","venue":null,"work_id":"0122226e-036c-42c4-8cc7-ff2b1d915265","year":2009},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.604403Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:5fe96d38aa4d7350dea147ca6033d039745c838ef69578d64bdd84eda99ea2a3","observation_id":"01625707-a1fb-4b23-80fe-c7e910ae8ee4","resolution":{"observed_at":"2026-08-12T10:35:49.686409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.663022Z","title":"A new image captioning approach for visually impaired people,","venue":null,"work_id":"ec826aa5-28ce-4a4d-a937-9cb5b043ede9","year":2019},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.610996Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:655c3cbfe8c8c1f70b42468bcb6c74a18a6f4618b8404999d3d76e6617d3886a","observation_id":"98a7afe5-4f63-4af1-9b41-b71994d8ea98","resolution":{"observed_at":"2026-08-12T10:35:49.668889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:47.617693Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.617693Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:2996fc51c2d15e8dbe6fe8a053f7ca508c24d926a29fed1952fa3ea6ac39dbec","observation_id":"f8072616-6ca4-43f8-aca7-d66831197f51","resolution":{"observed_at":"2026-08-12T10:35:47.617693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-12T10:35:47.624064Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.624064Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:3fa4bdfe0bf63c9850a9155d62ee17f4488b39385aeec1479e233edc1b8d3080","observation_id":"db1c39d6-f2ed-4bbf-9a2f-2d597d61f64d","resolution":{"observed_at":"2026-08-12T10:35:47.624064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T10:35:47.633004Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.633004Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:71a7b1affa8ab2b80417311e565eb2c65762b8d7fa5f51ce3ed685cf4276683b","observation_id":"3378b141-db95-40ab-b2a0-12a6ec8f5036","resolution":{"observed_at":"2026-08-12T10:35:47.633004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.634529Z","title":"Ferret: Refer and ground anything anywhere at any granularity,","venue":null,"work_id":"9672d763-f630-46d6-aee6-eae52c074e91","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.638597Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0ec86689283b60be6f06a1e95003190c560f3261cdc886e7319140f82e450e83","observation_id":"3d5890bf-6d27-48b3-ab1c-2e70abc6e4a9","resolution":{"observed_at":"2026-08-12T10:35:49.639549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.616998Z","title":"Osprey: Pixel understanding with visual instruction tuning,","venue":null,"work_id":"66bfb992-290e-46e9-a1bf-d90f1863e3f8","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.645570Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:5a4a000d5ab49df570e95c8298a3084d84cb33365f4653f5939b3ae1fe25bfab","observation_id":"56c4f11e-d411-4f34-93f5-f0d79587aaa6","resolution":{"observed_at":"2026-08-12T10:35:49.623325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.599638Z","title":"Gpt4roi: Instruction tuning large language model on region-of- interest,","venue":null,"work_id":"af63564f-5262-407f-b796-8304b0fa44e5","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.652677Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:ad3aaa406f571aa46dab7d5805c7970386d995598f3802d1ad3726f1d1ec0ab7","observation_id":"de5b4f10-c62b-4e9a-9b6b-ea1ea97dc266","resolution":{"observed_at":"2026-08-12T10:35:49.605571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.583106Z","title":null,"venue":null,"work_id":"5fe46897-c5be-43de-a862-14de6267a5b9","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.659736Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:c2b530a1e475704a868b682a3d8a17cde8a820914ab31afe82dfd97174175de7","observation_id":"a909808c-fc55-4a0d-90d8-cb50dcd1cae7","resolution":{"observed_at":"2026-08-12T10:35:49.587938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T10:35:47.665164Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.665164Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:5eb27fcd546eeecdd26380b539511b6e327a884bcfc205205c107d32d5b8d46f","observation_id":"ba6fc9cf-6e13-4474-8ffa-a4af28239ae7","resolution":{"observed_at":"2026-08-12T10:35:47.665164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.566142Z","title":"Say as you wish: Fine- grained control of image caption generation with abstract scene graphs,","venue":null,"work_id":"a4387127-09f5-4a7c-a15a-bb4d2f3e4984","year":2020},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.673001Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:d032dc128ba490af42847345afc7bc97da776c0edddbc8693c0da1b14b9461f6","observation_id":"40b2ef8c-f778-4c2e-9326-47cf79e61c84","resolution":{"observed_at":"2026-08-12T10:35:49.572137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.546416Z","title":"Human-like controllable image captioning with verb-specific semantic roles,","venue":null,"work_id":"eb2d3b2a-9c16-47bb-a5c8-48ed5121554d","year":2021},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.677938Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:328480a0824a08d203cb760273a9b8d96e410c16228d4ade9ad2011b5e452822","observation_id":"cb689d64-bb52-4b56-a096-6e6f5a6bb125","resolution":{"observed_at":"2026-08-12T10:35:49.552554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09580","last_updated":"2020-07-19T03:40:51Z","snapshot_observed_at":"2026-08-09T09:18:32.738830Z","submitted_at":"2020-07-19T03:40:51Z","title":"Length-Controllable Image Captioning","version":1},"cited_work":{"arxiv_id":"2007.09580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.09580","snapshot_observed_at":"2026-08-12T10:35:48.866059Z","title":"Length-Controllable Image Captioning","venue":"cs.CV","work_id":"a931fab3-1784-4811-aefe-9dd1ee6eef58","year":2020},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.683228Z"},"links":{"cited_paper":"/paper/2007.09580","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:b18154817449fe3052ae18e65243682f96095301f116ff809e986d5aed3f2003","observation_id":"064b0a90-495b-4473-ba0e-3aeea78d620a","resolution":{"observed_at":"2026-08-12T10:35:48.872869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.529013Z","title":"Image captioning with controllable and adaptive length levels,","venue":null,"work_id":"15bde532-f6f5-4db2-99eb-bb02008c2977","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.689741Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:a8812de5695efbe5d875faaf4b50f3c6e8bb9b2a1aeeb1a2a8945c0c2c63beb5","observation_id":"843e0503-0ea8-4a99-9f54-0194369f9ddc","resolution":{"observed_at":"2026-08-12T10:35:49.534740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.01431","last_updated":"2015-12-13T23:03:23Z","snapshot_observed_at":"2026-08-14T22:29:25.674499Z","submitted_at":"2015-10-06T04:57:47Z","title":"SentiCap: Generating Image Descriptions with Sentiments","version":2},"cited_work":{"arxiv_id":"1510.01431","doi":null,"metadata_source":"pith","pith_arxiv_id":"1510.01431","snapshot_observed_at":"2026-08-12T10:35:48.834900Z","title":"SentiCap: Generating Image Descriptions with Sentiments","venue":"cs.CV","work_id":"d838a644-1f25-4793-9307-34397b434c94","year":2015},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.694808Z"},"links":{"cited_paper":"/paper/1510.01431","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:acad217fc644121171ead965af06f443fd8f3293ef2976bf6a3727b385d637f0","observation_id":"78a9ab64-72f7-4c6a-9eba-bd8a51811d3e","resolution":{"observed_at":"2026-08-12T10:35:48.843335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.510851Z","title":"Alpha-clip: A clip model focusing on wherever you want,","venue":null,"work_id":"75910c6f-b804-4ccb-b659-082260542814","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.700614Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:77f58a4bdff4155ea440a61bfb599d1e97de42946ec4b7f4821364922c70a46e","observation_id":"353414c4-068d-43bb-90c6-dff0efe6be2d","resolution":{"observed_at":"2026-08-12T10:35:49.516778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.492057Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":"63861cea-748f-4076-ade7-212933460a8c","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.705960Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:57989cd7e6d41257c2498417760496520d3c248069573b70467f3c2dd0312d3b","observation_id":"17c5457e-12b3-41a9-999d-fe902ba830b8","resolution":{"observed_at":"2026-08-12T10:35:49.498047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.475108Z","title":"Open-vocabulary attribute detection,","venue":null,"work_id":"7dd0fc25-78d1-4f1f-80ea-f8cd8076af28","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.710740Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:fa370fa15069b11402961a72b315aec7c964c53c1820486adaf57a56833b3318","observation_id":"82254e72-4d11-4a24-9f3b-a45684d2e4ae","resolution":{"observed_at":"2026-08-12T10:35:49.480672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09506","last_updated":"2023-01-23T15:59:29Z","snapshot_observed_at":"2026-08-13T12:59:33.675210Z","submitted_at":"2023-01-23T15:59:29Z","title":"OvarNet: Towards Open-vocabulary Object Attribute Recognition","version":1},"cited_work":{"arxiv_id":"2301.09506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.09506","snapshot_observed_at":"2026-08-12T10:35:48.803063Z","title":"OvarNet: Towards Open-vocabulary Object Attribute Recognition","venue":"cs.CV","work_id":"3d060cd6-b61b-4ba8-b185-b92e5e4e6067","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.716653Z"},"links":{"cited_paper":"/paper/2301.09506","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:970e2e6ababad366b59d67237f5554f2fc8d014981d0652cb108ea62792286b1","observation_id":"28c062d1-fdf8-4f6f-ba7c-ca472fed1984","resolution":{"observed_at":"2026-08-12T10:35:48.810071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:47.722495Z","title":"Hierarchical visual attribute learning in the wild,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.722495Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:e52e956c72f7cde94b25fbae09c83c2f5e530c7c65e166b6e5395b17775f548d","observation_id":"5e38b85b-607e-4f10-8b20-9054436ded70","resolution":{"observed_at":"2026-08-12T10:35:47.722495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.457066Z","title":"Coco attributes: Attributes for peo- ple, animals, and objects,","venue":null,"work_id":"65869a52-557a-445c-9fad-e87c09a29b6e","year":2016},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.727724Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0be4500587c920cc384cd6279ef49eda812123e71b20cd510ba8e9e7a8039f83","observation_id":"fc1fc82d-f697-458a-9b53-36ee71e43d57","resolution":{"observed_at":"2026-08-12T10:35:49.463474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.439826Z","title":"Reflective decod- ing network for image captioning,","venue":null,"work_id":"14b257d8-a68c-4610-af68-b9f5aed9e528","year":2019},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.733902Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:2ddc24d160c438d313cf1898637e27f81a7b2d096a1570fba561f32e436706c1","observation_id":"7563b39c-d52d-4f5d-843d-c298fc1ee45e","resolution":{"observed_at":"2026-08-12T10:35:49.445416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.420299Z","title":"Show, control and tell: A framework for generating controllable and grounded captions,","venue":null,"work_id":"b7332b25-fc61-448d-9545-dd80471b051c","year":2019},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.739604Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:eb0762cb8e9405ea0d44276025a0ab88c3cb8d5bb354d4e709afdee6b24f83c6","observation_id":"af887a95-cd45-4343-a65b-eec3ae886a29","resolution":{"observed_at":"2026-08-12T10:35:49.425986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:47.745838Z","title":"Open-set image tagging with multi-grained text supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.745838Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:776e4680e6b7d18c0d9b5a573684f91a8b94d7124c7ac2d8d849e9d674320431","observation_id":"d0997027-8721-4b6a-9a6f-8fd0da4cc149","resolution":{"observed_at":"2026-08-12T10:35:47.745838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-13T11:23:36.861921Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-12T10:35:47.752131Z","title":"Recognize anything: A strong image tagging model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.752131Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:ba44c4b2a3055bcd6c350185c7df979e95c7a4af4c21c79ad8f8da00c8fe88fa","observation_id":"7d5c422c-c1a1-43d1-917e-6618f65fb836","resolution":{"observed_at":"2026-08-12T10:35:47.752131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05657","last_updated":"2024-03-18T12:34:30Z","snapshot_observed_at":"2026-08-13T12:27:57.289243Z","submitted_at":"2023-03-10T02:16:35Z","title":"Tag2Text: Guiding Vision-Language Model via Image Tagging","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05657","snapshot_observed_at":"2026-08-12T10:35:47.759661Z","title":"Tag2text: Guiding vision-language model via image tagging,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.759661Z"},"links":{"cited_paper":"/paper/2303.05657","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:bb4e5fd86c95e5f135184ae3a163615ccf2819907912ffb6317e92473bd6e5e6","observation_id":"2cea303c-2bea-4d47-b397-696cac09c554","resolution":{"observed_at":"2026-08-12T10:35:47.759661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.393048Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":"67cf4ef1-74d3-4883-ae9b-8f5b0b2a1dfd","year":2018},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.767206Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:4811752b0afca4b01a776a5674c82ae293d6f8105d5229f7816b63e50095e657","observation_id":"9675df14-9443-47ca-9e2e-1783d99e4690","resolution":{"observed_at":"2026-08-12T10:35:49.398305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.376275Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"cad413c7-d405-409b-8309-57afd34d63fd","year":2022},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.773535Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0bd1d9e0d9b4a2ac7ce976ee2343e80c4d79f7d2b99fbfda834f642574656529","observation_id":"594f5d7a-b24f-4360-8630-34a301c74082","resolution":{"observed_at":"2026-08-12T10:35:49.381669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.359236Z","title":"Docci: Descriptions of connected and contrasting images,","venue":null,"work_id":"855806a5-2092-4cd4-b70f-00a13b306609","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.778783Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:c6cb93235292a98cd6fb5e1c7217cca593d9db540dd3fcbbe1f0740f2100e7cf","observation_id":"ad253e3f-9fce-4674-a0d4-ff678e1d337e","resolution":{"observed_at":"2026-08-12T10:35:49.364637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.340750Z","title":"Dense and aligned captions (dac) promote compositional reasoning in vl models,","venue":null,"work_id":"ce7af675-a260-48d9-b102-556f179b14c7","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.784510Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:f78e0a91a24bf1499c25bf4597f3fec9524e256f62644af8441466ee97671d1d","observation_id":"19b32b7a-0943-4593-8318-435522822cea","resolution":{"observed_at":"2026-08-12T10:35:49.346553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.322153Z","title":"Pixlore: A dataset-driven approach to rich image caption- ing,","venue":null,"work_id":"bd940536-508d-47d6-9033-ba1a61bccffc","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.789767Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:9311314371b1c2c53190ea8bc7608290f1a6f8cd7830f2b7bf80eaec74a32f26","observation_id":"a94cc381-02df-4ff5-b333-c36e5e55d52f","resolution":{"observed_at":"2026-08-12T10:35:49.327577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08822","last_updated":"2016-07-29T14:26:27Z","snapshot_observed_at":"2026-08-14T21:46:12.314482Z","submitted_at":"2016-07-29T14:26:27Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08822","snapshot_observed_at":"2026-08-12T10:35:47.795510Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.795510Z"},"links":{"cited_paper":"/paper/1607.08822","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:c68b3e049730d027b0971d962cfbd2e35aa49eeaf38b900b052c550d17e2dcd6","observation_id":"13d4cd19-ccc3-41bf-88b0-4a282f552ba7","resolution":{"observed_at":"2026-08-12T10:35:47.795510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.303781Z","title":"Cdkm: Common and distinct knowledge mining network with content interaction for dense captioning,","venue":null,"work_id":"517bd36f-087d-4250-b755-76798786eed2","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.801592Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:7a35827fdf7f1e327e27fb9f0c840a663e4e44dbf63ac22125abf2ab0eae1ba9","observation_id":"e3d82ea8-504c-413c-ae82-8aeb7f70dc96","resolution":{"observed_at":"2026-08-12T10:35:49.310238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.285897Z","title":"Icocap: Improving video captioning by compounding images,","venue":null,"work_id":"424f4e05-e709-4b41-b478-41319de1f87c","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.807248Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:a09dd939474b1cbb8f6e33644beb8432681cf2574ed802ecf1dceae743afa7dc","observation_id":"8fdda0a4-519f-4c14-b4dc-2064fc8e02c3","resolution":{"observed_at":"2026-08-12T10:35:49.291115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.269076Z","title":"Fine-grained image captioning with global-local discriminative objective,","venue":null,"work_id":"19747147-d903-4b46-b2de-a441b9ee8bcd","year":2021},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.813906Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0210d878cab5ad22ee8ddacd005d6d091442aa7a3fe95c232e068db4af8b285d","observation_id":"5f221a8c-83e2-4ce4-8d64-a6894a515d8b","resolution":{"observed_at":"2026-08-12T10:35:49.274636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.250695Z","title":"Mul- titask learning for cross-domain image captioning,","venue":null,"work_id":"47b9ac91-c8c5-4546-8ac2-90b388fdc849","year":2019},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.820027Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:1ddcba02bdc405d2150ec9b325a9478aeef873fb41eda75ee499ddc29f7687f7","observation_id":"3a4e2ebd-d14d-477b-9362-7c56e870d7ad","resolution":{"observed_at":"2026-08-12T10:35:49.256275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:47.825939Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.825939Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0115fde854ac676910e003b058a70bce855e795f2e063f28ab15e716c41378d1","observation_id":"4db71749-ac45-4575-9548-0e84ad3439c6","resolution":{"observed_at":"2026-08-12T10:35:47.825939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-13T20:44:11.024473Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-12T10:35:47.832245Z","title":"Imageinwords: Unlocking hyper-detailed image descriptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.832245Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:1a3475aa10dc6d7fe778f20595f3d42c75edc4a26b76f4dd6fd23d80504a921b","observation_id":"40bc00fa-2b03-46d7-a8f4-5543bde6e78d","resolution":{"observed_at":"2026-08-12T10:35:47.832245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.221191Z","title":"Boosting entity-aware image captioning with multi-modal knowledge graph,","venue":null,"work_id":"71857864-91bd-4b68-b5b1-6c31cf2bf94b","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.837917Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:4ab14c0a311217b76ab4a215e474fb6f6648fdb182014409900505656e5cb091","observation_id":"952c4115-cedb-43a8-a491-a31df8724bf0","resolution":{"observed_at":"2026-08-12T10:35:49.227154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.203918Z","title":"Describing like humans: On diversity in image captioning,","venue":null,"work_id":"7ad9aa85-2e30-470b-8a5b-0aca4e2390d5","year":2019},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.843340Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:88fcd0cd5e3101e8765660444d846ae0e12942aec158295642ba7568e6ffd764","observation_id":"47b3914d-8339-4831-905d-14e8ededf831","resolution":{"observed_at":"2026-08-12T10:35:49.209834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:47.849028Z","title":"Benchmarking complex instruction-following with multiple constraints composition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.849028Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:d2742ca07d6ce5820e74898b21b61bd68de667780033b668f163e149f4cf4352","observation_id":"9462c86b-b03c-4ed8-834c-07fdad930a34","resolution":{"observed_at":"2026-08-12T10:35:47.849028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.175165Z","title":"Densecap: Fully convolutional localization networks for dense captioning,","venue":null,"work_id":"e8fd0f57-14c2-41d3-94d8-b57a188b42ac","year":2016},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.862137Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:9eef0464af60bc36d2930780692609e19f7fa362ae8c386e37a484cafab95859","observation_id":"d6c24d2b-b081-401b-961d-5806342bf03d","resolution":{"observed_at":"2026-08-12T10:35:49.180368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.157397Z","title":"Controlcap: Controllable region-level captioning,","venue":null,"work_id":"69b71348-6af3-4ebe-ad70-5a012fab0213","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.867248Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:99a3e5907ef35eb21e1deb5c4f190e4c17d5ba5c6d15a7cb9ec0c85b667638a9","observation_id":"b26ba455-6353-4ab9-b9bb-8492f294d36b","resolution":{"observed_at":"2026-08-12T10:35:49.163671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-08-14T11:50:26.845660Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-12T10:35:47.874399Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.874399Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:3ea98b9e8d760ac0fddc46620e9582f7d9014ae55f8155446cd15f3c172b2063","observation_id":"7dc12e9f-7bb0-41b4-b2cb-279501b2d840","resolution":{"observed_at":"2026-08-12T10:35:47.874399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04302","last_updated":"2024-03-20T23:32:08Z","snapshot_observed_at":"2026-08-13T14:28:24.093716Z","submitted_at":"2023-12-07T13:53:29Z","title":"Prompt Highlighter: Interactive Control for Multi-Modal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04302","snapshot_observed_at":"2026-08-12T10:35:47.884042Z","title":"Prompt highlighter: Interactive control for multi-modal llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.884042Z"},"links":{"cited_paper":"/paper/2312.04302","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:4c829482508eb9d7a21583621a4f95569df7876a189cd2db0246f4fe99ba3cb9","observation_id":"9d266fd7-6f17-43ec-aa48-8eafa2903e2a","resolution":{"observed_at":"2026-08-12T10:35:47.884042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12026","last_updated":"2025-01-28T23:14:21Z","snapshot_observed_at":"2026-08-13T00:51:01.072545Z","submitted_at":"2024-03-18T17:57:02Z","title":"FlexCap: Describe Anything in Images in Controllable Detail","version":2},"cited_work":{"arxiv_id":"2403.12026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12026","snapshot_observed_at":"2026-08-12T10:35:48.412221Z","title":"FlexCap: Describe Anything in Images in Controllable Detail","venue":"cs.CV","work_id":"46157200-b0cb-4812-9e1c-230d45dba70f","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.890020Z"},"links":{"cited_paper":"/paper/2403.12026","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:b7e1a31784f4b52a2b125fc332da36fcd8e1d705881b33069c7c15533a485348","observation_id":"241b12de-afc9-4a69-8aa0-7c188425219a","resolution":{"observed_at":"2026-08-12T10:35:48.419082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-14T08:13:07.883201Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-12T10:35:47.895609Z","title":"Caption anything: Interactive image description with diverse multimodal controls,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.895609Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:56a389d4d8c20e200517db9ae98a43e4f98ab50834d22afb6eecc1e3b851531b","observation_id":"a17ba614-9c42-406a-be2a-490781254861","resolution":{"observed_at":"2026-08-12T10:35:47.895609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.138154Z","title":"Debiasing pretrained generative models by uniformly sampling semantic attributes,","venue":null,"work_id":"f3512ad4-d81e-433d-bdc8-70d656fea4cb","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.902410Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:888598553b9b5fd5ff63563ecb4b98f5f11faf9bf485dcc3c4d1cea41d2ebe41","observation_id":"6b999e30-97e3-4414-ab62-820aaafc0919","resolution":{"observed_at":"2026-08-12T10:35:49.144490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.118238Z","title":"Unifying visual attribute learning with object recognition in a multiplicative framework,","venue":null,"work_id":"4839be84-e0cd-4873-bc79-bbfd2d45bdbb","year":2018},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.908845Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:8b52c387bfaddcfe59ad7eddbe53df3f25dc86bdb92fea12f864382d75e3056b","observation_id":"971ced30-02e6-434f-98ec-559cd1f75ba9","resolution":{"observed_at":"2026-08-12T10:35:49.125290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.098011Z","title":"Learning to parameterize visual attributes for open-set fine-grained retrieval,","venue":null,"work_id":"932e9890-d94c-494d-9f02-2827a3df9c43","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.914817Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:ba05780fe696dd96afa4194f2670355086e2f87da5cd4c93116a2119dae66abc","observation_id":"f3c2e607-1ce7-49fd-825d-db348c506a6e","resolution":{"observed_at":"2026-08-12T10:35:49.104239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01231","last_updated":"2024-03-10T15:12:35Z","snapshot_observed_at":"2026-08-13T10:27:15.400915Z","submitted_at":"2024-03-02T15:20:09Z","title":"Benchmarking Segmentation Models with Mask-Preserved Attribute Editing","version":2},"cited_work":{"arxiv_id":"2403.01231","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01231","snapshot_observed_at":"2026-08-12T10:35:48.345507Z","title":"Benchmarking Segmentation Models with Mask-Preserved Attribute Editing","venue":"cs.CV","work_id":"489fbcf6-182f-4baa-9cc0-40788ade0117","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.920039Z"},"links":{"cited_paper":"/paper/2403.01231","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:3ef1772ab767e126b9f3aee7f9153fe79407f8f15cda38c0ce06b77c0d91048c","observation_id":"2f5b3f3b-7c3f-4c2e-a7ed-d661bd9b06ba","resolution":{"observed_at":"2026-08-12T10:35:48.354732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.076587Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering,","venue":null,"work_id":"8ab298a9-f469-49e7-b08d-c25577780dcb","year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.927030Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0e78baeed324ab30f9d2bf4cb16eb4b8ea3e98f890ec55dc5eec22d19a3c78a7","observation_id":"d0bf7c53-756a-426f-81a1-f75c003871b1","resolution":{"observed_at":"2026-08-12T10:35:49.083310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01509","last_updated":"2025-03-20T02:49:09Z","snapshot_observed_at":"2026-08-14T22:18:01.140863Z","submitted_at":"2024-07-01T17:53:35Z","title":"MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01509","snapshot_observed_at":"2026-08-12T10:35:47.933082Z","title":"Mia- bench: Towards better instruction following evaluation of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.933082Z"},"links":{"cited_paper":"/paper/2407.01509","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:f90e2e965af06ca1f34b7406cf41171ecb566e8e3ddce206eb6d680efc9d354f","observation_id":"5855857a-2d3e-48db-b118-5ffda950003e","resolution":{"observed_at":"2026-08-12T10:35:47.933082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.055696Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":"c5d800d5-2811-4c55-8c18-020805011375","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.942139Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:24e23d14aebe269937b22fb77c2a8aabe52cf9cbfe5b57f1cab296fefaea3385","observation_id":"5b524447-7507-44f3-be44-13baf064773e","resolution":{"observed_at":"2026-08-12T10:35:49.062367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T10:35:47.949483Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.949483Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:068037e79e9a6f138b771863b5974db179e66c1171100759a6241f3c101b40c5","observation_id":"7ef05d19-4bdf-4ba8-a320-65cb317a3dd5","resolution":{"observed_at":"2026-08-12T10:35:47.949483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-15T07:24:00.194246Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-12T10:35:47.960523Z","title":"Seed- bench-2: Benchmarking multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.960523Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:b9d478437e4c49b3dd172ed9afa8b952d0dfed871068767f474b8e0cdcfce189","observation_id":"a54a24cf-6522-4bd2-83e7-d1116c974f2b","resolution":{"observed_at":"2026-08-12T10:35:47.960523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-14T09:18:55.769794Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-12T10:35:47.966757Z","title":"Seed-bench- 2-plus: Benchmarking multimodal large language models with text-rich visual comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.966757Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:461e4b14e8e65478a91c2af556f07262aec8d668977b320a4a1467f43c2450e3","observation_id":"18e991f0-6e74-440d-ac84-0659174b7709","resolution":{"observed_at":"2026-08-12T10:35:47.966757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-13T05:41:56.516364Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-12T10:35:47.975805Z","title":"Woodpecker: Hallucination correction for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.975805Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:f609363df00cdae69f457cd5ae74dbf53a2c0719f4e8c78afaed03736c68eec1","observation_id":"0f595b07-6d6b-471b-a02a-5b098af6f983","resolution":{"observed_at":"2026-08-12T10:35:47.975805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01477","last_updated":"2024-09-26T19:44:31Z","snapshot_observed_at":"2026-08-13T05:34:34.870548Z","submitted_at":"2023-11-02T01:21:45Z","title":"FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01477","snapshot_observed_at":"2026-08-12T10:35:47.985941Z","title":"Faithscore: Fine-grained evaluations of hallucinations in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.985941Z"},"links":{"cited_paper":"/paper/2311.01477","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:88d4b3e237074490a8f1baf11d2d1df4995db11d0ec3c07d40478aadec2bd171","observation_id":"c992c0a2-7dc5-421f-ac95-62ad52703d06","resolution":{"observed_at":"2026-08-12T10:35:47.985941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T10:35:47.992435Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.992435Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:65725cc90a40ead51d856ade5216192f67d3b27796eab3684d84b3de81204a89","observation_id":"514c7eca-6f46-40c8-bfdc-8f0243fb3bfa","resolution":{"observed_at":"2026-08-12T10:35:47.992435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.037091Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation,","venue":null,"work_id":"a9a788e2-6579-4fe9-beb7-7763f09cdb4e","year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.999331Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:c8c9e4d717261e3783871860d7c9beaa1032b0db0638bc6629139ada73050359","observation_id":"73ef9f90-9d6e-4db9-99a7-1e95f222cbb7","resolution":{"observed_at":"2026-08-12T10:35:49.042580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.017687Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"012d50a0-e84b-4b31-a272-d22e10ba8a19","year":2002},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.005430Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:6c1c54c64360a52556a537cf6a1a0fc9664f4489315659d6d8cb4c6fccef611c","observation_id":"3cb156dc-3df5-43f7-993b-0464db26413a","resolution":{"observed_at":"2026-08-12T10:35:49.024308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:49.000195Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":"5f11581a-d830-4d9c-8724-4da2d0e90f50","year":2005},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.011868Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:d8ecd7f13ebf753b0697d3178e049f0172f523cce219e5f5613ac22b560de85b","observation_id":"3e2b5125-5d48-40b7-8675-7ba40dd47cde","resolution":{"observed_at":"2026-08-12T10:35:49.005724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-14T23:10:48.763001Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-12T10:35:48.017689Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.017689Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:0954da4c0852eec6afdc1f290a75d724bc9b0d1274a24bfd1dbac40938824b1d","observation_id":"20e61f48-e320-4dad-b4c3-44551232a430","resolution":{"observed_at":"2026-08-12T10:35:48.017689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T10:35:48.024015Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.024015Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:9e3aaf61f9c95f3a7ca7084c623a6ca8f80e220c6c8b5f032caeb10f41fecf75","observation_id":"f3332ba3-5785-42de-b973-7e501621c279","resolution":{"observed_at":"2026-08-12T10:35:48.024015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:48.030002Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.030002Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:49c137ad13a4179e9a89e4e7d7a9d779f0f995b416f1ee874a08fc171943449a","observation_id":"a0577e74-aa53-4d04-8388-75a6a5aa47dc","resolution":{"observed_at":"2026-08-12T10:35:48.030002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:48.039061Z","title":"Vicuna: An open-source chatbot impressing gpt- 4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.039061Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:673d07d8fd0221b50c414fc56046d792137da2d338ca8363833964b9bd572beb","observation_id":"c1152873-3296-4039-8d8f-dd6aee64ba02","resolution":{"observed_at":"2026-08-12T10:35:48.039061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:48.046825Z","title":"Llama 3 model card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.046825Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:edc8bb2bfe5ee991ade4bae684a8944272f3d9547fb06ed2f6b50b799845a398","observation_id":"a779451d-4b33-46cf-8b22-2473c7e98cfa","resolution":{"observed_at":"2026-08-12T10:35:48.046825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:35:48.056317Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.056317Z"},"links":{"citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:6626df225ce01da86c6bc568eeae7f851a18bd83a1e6c26851e8c9d70769ed67","observation_id":"bf3e4c25-36dc-4702-a277-c20a1ec407f8","resolution":{"observed_at":"2026-08-12T10:35:48.056317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03978","last_updated":"2024-10-31T08:11:04Z","snapshot_observed_at":"2026-08-12T23:28:45.822390Z","submitted_at":"2024-07-04T14:50:45Z","title":"Benchmarking Complex Instruction-Following with Multiple Constraints Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03978","snapshot_observed_at":"2026-08-12T10:35:47.855603Z","title":"Available: https://arxiv.org/abs/2407.03978","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:47.855603Z"},"links":{"cited_paper":"/paper/2407.03978","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:2a9d9583f1580ab2100e91b8c609a6ce9fa61ee4179fd0087eafb327641153b9","observation_id":"64d73cef-163e-4ba0-ab26-dc194996979f","resolution":{"observed_at":"2026-08-12T10:35:47.855603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:08:00.107062Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":5,"verified_fuzzy":35},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2411.19106."}