{"as_of":"2026-08-14T16:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45f6f84dff2568927bbbc233825c46bcee43b0389d8278e5e16b4fd664976a42","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:59:15.664441Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01008/citation-record","integrity":"/paper/2508.01008/integrity","json":"/paper/2508.01008/citation-record.json","paper":"/paper/2508.01008"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T05:59:15.447253Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.447253Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:105a9efcf1396aa8d375d66633e23dc5a4e1c22c39a77258019e3175e95a3f53","observation_id":"77de1c1f-5091-4938-912a-95ea6d7ab884","resolution":{"observed_at":"2026-08-06T05:59:15.447253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.253097Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation, 2023","venue":null,"work_id":"825980f3-4e79-4604-b112-10ded93847c1","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.452642Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0aac4fd3d1b65419169d0d33eaf1e34700e24dc08746673246aa3587bb0756c4","observation_id":"f33e43e0-5ac2-4c4c-8846-dc8f5da62df4","resolution":{"observed_at":"2026-08-06T05:59:16.257836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.242018Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":"bb8026e8-2037-464b-8453-3c5d9a753fd1","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.456356Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:3289268306ffadf92dce5312068e3e8e4ea6a0d57792ce066d004471f5d687fb","observation_id":"ef88c5b7-ba2f-4644-8814-2ded100596c5","resolution":{"observed_at":"2026-08-06T05:59:16.246018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T05:59:15.459932Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.459932Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:1d6692a61304cd1d03cd6b1968485d16160ad83832755f9c73b15c79d21a9294","observation_id":"3e6b6bcd-aa20-4a8d-b405-71ccf698ba34","resolution":{"observed_at":"2026-08-06T05:59:15.459932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T05:59:15.463874Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.463874Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:172e1fddb9c22f60f95d1ac744d5c593b25dcb03a307ff94c605b4ea87e05983","observation_id":"7a802e98-d67a-45ec-9e3b-86fedc30fa33","resolution":{"observed_at":"2026-08-06T05:59:15.463874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.231544Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"c95bc6b5-bf71-470e-b9c3-6de683630bc2","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.468885Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:da4c6a78f4888de8c58a2d8f422305a3985b851bddd31547073352cf7304b5c6","observation_id":"a57f74c1-180f-4dfc-b297-6559e7eb33a7","resolution":{"observed_at":"2026-08-06T05:59:16.235144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T05:59:15.472695Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.472695Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d6e2966c3b199ad7699eda3e52d2d24705fefa95deddd553469012ac2940d807","observation_id":"2701598b-bad2-4951-823f-fd574c4888c2","resolution":{"observed_at":"2026-08-06T05:59:15.472695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.220346Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"5c908135-862d-401f-864e-eb9748bd0a2f","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.476994Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:94f9727d00cf50ae4bf97dbae27cb440855765891c8173bb938fe54cc8269d28","observation_id":"fff1f503-be48-4288-bdd8-83c895fcb5e5","resolution":{"observed_at":"2026-08-06T05:59:16.224851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.210491Z","title":"Laion pop: 600,000 high-resolution images with detailed descriptions","venue":null,"work_id":"9d2e152a-ebbe-4eeb-9800-f2d06f4359f6","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.480962Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:54c2dbb72a78c31003253ffb41d5f88c60070e1e6cf3d22cfce29a6c45f97301","observation_id":"7b7cdf4a-83c0-4d7a-b55d-36bb5c69dc3c","resolution":{"observed_at":"2026-08-06T05:59:16.213947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T05:59:15.484280Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.484280Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:b56f36c672a8666de6b39e6816e65d94582bc2fd6047ed588b9479ff921722e3","observation_id":"50095dc7-82b3-46e9-aa8d-9d29971cf9c3","resolution":{"observed_at":"2026-08-06T05:59:15.484280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.199860Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"2e2f57e6-1349-49ec-a0b6-32f68fe36dcd","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.488421Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:1c9e335d5b3bfdcc03d164aeebafe331d390939b87cef114937d385e9ed61454","observation_id":"9438a0ce-ce74-4342-978f-57d03d86a504","resolution":{"observed_at":"2026-08-06T05:59:16.203931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.189870Z","title":"Ranni: Taming text-to-image diffu- sion for accurate instruction following","venue":null,"work_id":"8fe90b3f-6fdb-450a-8102-1d5a0a4152c0","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.491661Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:5c6b1e049b3793f2e5249903bc9d56d1d46c544e0240d342d412e5906062110f","observation_id":"93e15a82-0e6c-4825-9092-8b0da2d411f8","resolution":{"observed_at":"2026-08-06T05:59:16.193135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-13T20:44:11.024473Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-06T05:59:15.495125Z","title":"Im- ageinwords: Unlocking hyper-detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.495125Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:ab61a3b06b08610f2ea44c2985110de55614ae81223d27b5df94581b5f0bf118","observation_id":"e6dc0a98-1f1e-4dd8-af7e-2e8d392853db","resolution":{"observed_at":"2026-08-06T05:59:15.495125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T05:59:15.498764Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.498764Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:13d3c23055796f0c5fd3cd4785de896bf9e13a6c3b98ed736f206eb8ff692e06","observation_id":"5a4d026d-e51f-4c69-a263-2353e07f88ec","resolution":{"observed_at":"2026-08-06T05:59:15.498764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.502311Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.502311Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d56dd1845c3c4ed68ffee6059d9fc127267fd417f69bcc7f5e1c5a3438403c52","observation_id":"ec4ef736-a22c-4e54-80d8-2e2fcf0e8f87","resolution":{"observed_at":"2026-08-06T05:59:15.502311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T05:59:15.505850Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.505850Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d88368787bb2419ea85f5fb74f580591ed2b17a17cad8898f7f9ac1ca0eb8ff8","observation_id":"9d6ebf94-b546-4cf6-a2f0-048608780046","resolution":{"observed_at":"2026-08-06T05:59:15.505850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.173772Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"b0b14243-e802-411c-8846-aab10ce69b4b","year":2019},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.509041Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:5714a7214d92db31580974fd57d8393c9307d3fde34d994bdcd58813f57f0f53","observation_id":"a68c98e0-5d59-45c3-bc17-f5f3da9c8edc","resolution":{"observed_at":"2026-08-06T05:59:16.177516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.163606Z","title":"Retrieval-augmented open-vocabulary object detec- tion","venue":null,"work_id":"5c0269d4-1c71-4a78-ab21-fe6ca3bc0952","year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.512266Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0a44755d01726817ffc730ea472e33d82af76b1749b129ffbb7127b19a4d77aa","observation_id":"2e451c29-f81e-4700-93a1-111666ef7e24","resolution":{"observed_at":"2026-08-06T05:59:16.167216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.153464Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"3e008309-b7e9-41ec-9450-2d1af294fe33","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.515883Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:bdc8ef4def0864058a4cd548e10714a3bb2f2255afaa235d02b739986577dac6","observation_id":"56937916-9015-48ff-8881-f86b7f20af56","resolution":{"observed_at":"2026-08-06T05:59:16.157206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.142503Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"ae82edcc-4ba7-4fc6-8e16-79b6c0cd1ef1","year":1956},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.519045Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:47d1b588d175477860dc1ad51943b4514bb0e47638248dfb318d6d0f1de17776","observation_id":"9f95e6be-3bc2-4573-a786-0fcd6d081036","resolution":{"observed_at":"2026-08-06T05:59:16.146463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.132658Z","title":null,"venue":null,"work_id":"e9d13348-d8e3-48f1-8efd-94f5e0d4e646","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.522276Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a9d81072f285ffe1862eb995ce788d8145c0f1450e47fb84a3bcdd7c8ee371e6","observation_id":"464d037d-087b-49e0-9697-6f1fcd9db6f0","resolution":{"observed_at":"2026-08-06T05:59:16.136002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.525838Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.525838Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:4f0017391feb2c6075bef595994634013df6781b159ed107f2d617a7d834c1bd","observation_id":"d3545566-8d32-40b4-aa70-4d3e0ffd41e4","resolution":{"observed_at":"2026-08-06T05:59:15.525838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.528965Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.528965Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:4ff2e836d0a9133348a5b9ddd312abe1b7d7662f7d2bb2fe8036234a9445891d","observation_id":"e6613a77-2f33-4490-a7b4-c1de1d298e74","resolution":{"observed_at":"2026-08-06T05:59:15.528965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-14T09:04:40.967071Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-06T05:59:15.532357Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.532357Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:84a853215cace9b3319d876bd8b3fb746ee61edb29f6900a5efa64366674771b","observation_id":"65e9596d-df25-4270-9e01-7f6ddaa0cb37","resolution":{"observed_at":"2026-08-06T05:59:15.532357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.110818Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"0b24375b-fba6-4b8e-8493-1b0ebfbe8fe5","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.535880Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0396ce522bd006e3465e56bc45f425aa27d2be902a5b517e21335ba1df4bc75f","observation_id":"584874c4-b51e-4df2-be1c-ad3ddeaf8f06","resolution":{"observed_at":"2026-08-06T05:59:16.114320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T05:59:15.539301Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.539301Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:298e2268cdfc94fe0609453c720570893d2d16fd2527da9cb3f50a4815f93e10","observation_id":"0a12d2be-2083-4d49-a18a-e96e4b528ae4","resolution":{"observed_at":"2026-08-06T05:59:15.539301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.100538Z","title":"Lawrence Zitnick","venue":null,"work_id":"7d04880b-f580-4b23-ac87-10ad62bdf530","year":2014},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.543230Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7779c8345f22ce738dfbf3f27ec32fb8078e576731d109bc6acb626073f22425","observation_id":"8cef9ff0-f18e-4e6d-8890-d331dedf1ee3","resolution":{"observed_at":"2026-08-06T05:59:16.104144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.549776Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.549776Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:e4a8c441fad397f151863b3ae5af58a19a0b78bd139ae85e845dcc4c03070bec","observation_id":"2972c372-c46f-4923-8e19-7c1e3701b694","resolution":{"observed_at":"2026-08-06T05:59:15.549776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T05:59:15.553172Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.553172Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:ffdfcc8b2a376d4fafc71f57f103ff8dbd650c3e14bd850c857b42f36512238d","observation_id":"799ba3a8-7c66-47d6-a6db-eaa58a0cc94a","resolution":{"observed_at":"2026-08-06T05:59:15.553172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.077109Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"dcc1ef74-3c4a-433c-9a7f-e0aa1ec6ce3f","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.556574Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:c288f8dbc6b4d99232b7ff01e00ccae1767864425c4d97a39f53e8b53a80a2da","observation_id":"798db917-1c23-4eec-abe9-48093b64d801","resolution":{"observed_at":"2026-08-06T05:59:16.081578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-08-13T11:37:24.849967Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-08-06T05:59:15.559791Z","title":"Docci: De- scriptions of connected and contrasting images, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.559791Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:9e56fbef2311f07a422168de6a744696f642dfa4d350c79d7c1ec622be2bf486","observation_id":"c1b18570-5a77-4e14-9520-86630e70cc47","resolution":{"observed_at":"2026-08-06T05:59:15.559791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.563418Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.563418Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d1eb1380106f532ab2a08aa644420d9653fcfd028e72a371105f292d74a25f32","observation_id":"85db6f9c-64c4-4290-9846-e28f3d23432d","resolution":{"observed_at":"2026-08-06T05:59:15.563418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.567213Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.567213Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:07379391ec9a6bdd43af2d2dda1bc7103bde8f5a81fa8f96bf38315edb57420f","observation_id":"98b81ee6-cd5e-49ce-9fd9-270e1e435e55","resolution":{"observed_at":"2026-08-06T05:59:15.567213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.055439Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":"9ba6bda8-db6c-4f49-a45b-55ff4d5ecff5","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.570668Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0b7f3b9dbe69456f70a9c11c373c607e98fefd68c4f662c4e3e2cb42951592f8","observation_id":"1837cca4-5c02-4d3f-8e1d-aaf441661d65","resolution":{"observed_at":"2026-08-06T05:59:16.059036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T05:59:15.573917Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.573917Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:8b888f141674e6494c16dc7d58d37d8da7fe75ec3e90c9f042998ae519f07577","observation_id":"908b97f6-22de-4fb2-afdc-1d8c298085bc","resolution":{"observed_at":"2026-08-06T05:59:15.573917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07082","last_updated":"2020-04-23T04:22:16Z","snapshot_observed_at":"2026-08-14T01:19:29.014936Z","submitted_at":"2020-03-16T09:05:53Z","title":"Stanza: A Python Natural Language Processing Toolkit for Many Human Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07082","snapshot_observed_at":"2026-08-06T05:59:15.577307Z","title":"Stanza: A python natural language processing toolkit for many human languages.arXiv preprint arXiv:2003.07082, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.577307Z"},"links":{"cited_paper":"/paper/2003.07082","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:063e96fff3135679f802a317eb6441c37cc36493344037f7adfc7a6f5b22aa66","observation_id":"7024cd76-2a0d-4eac-b776-c3a1ede5c2a1","resolution":{"observed_at":"2026-08-06T05:59:15.577307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.580791Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.580791Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:32be87eaa29613bae46fa158314382ffc7a3953e109f6dec4050d577c6e3e3c6","observation_id":"afaf257b-0d06-4304-b251-59a663769a15","resolution":{"observed_at":"2026-08-06T05:59:15.580791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.583942Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.583942Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:24f18c11d4e3c4bd11ccfedc2f7875409c37b464536e3141a21e5c86d89bd8ff","observation_id":"37938214-507b-4431-8e29-4124034599db","resolution":{"observed_at":"2026-08-06T05:59:15.583942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.033393Z","title":"Stable diffusion v1.4 checkpoint","venue":null,"work_id":"766f3d45-33b8-42e8-a34c-1aa4f3ecf1f9","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.587044Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:3c61b7ee0914f9a5da8816bebb3f77743bf2a04cb73c2e923c31ea4f25badfa1","observation_id":"b8a4b91e-1cbe-4866-8916-23bf32daaf28","resolution":{"observed_at":"2026-08-06T05:59:16.036870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.022954Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"29ad4127-f130-44bc-b804-9f3c2d6b10aa","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.590226Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:8744e4041a025fa93620f2b3d2133bbf179b5314ac6f8f5f7d6ac9f05704486d","observation_id":"e9e2b47d-7207-4603-92cc-7fafccf75e71","resolution":{"observed_at":"2026-08-06T05:59:16.026532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.013019Z","title":"Laion-aesthetics","venue":null,"work_id":"a3c97109-3904-433c-9c98-412a5238675b","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.593501Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0f669c682b5a90c68f69f29ac40682e6c8d9f8402e1128d0123c89d51eda1856","observation_id":"9d4a3a27-5444-48bf-a621-28759a4034b5","resolution":{"observed_at":"2026-08-06T05:59:16.016615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.596983Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.596983Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a15d6d20ec6efe7493439a7db08eba04289fe4e7d00437c194281998674e566f","observation_id":"f4fa66e1-ddd9-4b72-a679-bfe17225964c","resolution":{"observed_at":"2026-08-06T05:59:15.596983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.995537Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"a2e98c30-3b2e-4fa4-9ebc-36cfa19129c3","year":2019},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.600205Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:6fc8f2813d561f4e364b13f7786e4f2f64d8f674dc7dc5962290a55edc3eabb4","observation_id":"4d9d324e-7f0f-45f4-b0ec-5ecbacbdd76f","resolution":{"observed_at":"2026-08-06T05:59:15.999193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-08-14T13:42:52.882986Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T05:59:15.603444Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.603444Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:84384e06a6230c985fdf6aefaa7953a2c1661adfa136f66717dbaff9d52e0020","observation_id":"ce87387f-6774-4174-adf5-76bfa3e64914","resolution":{"observed_at":"2026-08-06T05:59:15.603444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T05:59:15.607151Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.607151Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0629d99a0a03b97f4b3db39093a75a41e4e8dae305faca33eb2849d8bc22a09f","observation_id":"f2d401de-1157-4434-96b8-28f7dea11fce","resolution":{"observed_at":"2026-08-06T05:59:15.607151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T05:59:15.610644Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.610644Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:1562bb4586f98b6f70c67047c126c15983c4641c1cf5dcfeab717563945521d9","observation_id":"38c09d6d-ded2-4e7b-b0ad-e15987f7c9b6","resolution":{"observed_at":"2026-08-06T05:59:15.610644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07844","last_updated":"2024-07-22T03:26:21Z","snapshot_observed_at":"2026-08-12T23:24:49.894971Z","submitted_at":"2024-07-10T17:05:49Z","title":"OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07844","snapshot_observed_at":"2026-08-06T05:59:15.615039Z","title":"Ov-dino: Unified open-vocabulary de- tection with language-aware selective fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.615039Z"},"links":{"cited_paper":"/paper/2407.07844","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:27885481d527c8acf9d089256cd59f37ffe6c5fc28f1844925a1d863615d6be3","observation_id":"9742e30f-4e89-4261-add6-acde697eeb25","resolution":{"observed_at":"2026-08-06T05:59:15.615039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.985162Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"e12d6a6b-dc8d-4c6e-af10-3c6b2854a2bb","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.618896Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7175a26c51fd755dbf87c54bb5240556d671d30ff9fe8d35b3649ea6fc267a95","observation_id":"6f6a7ee7-658f-4415-8b68-9d49ee5de36f","resolution":{"observed_at":"2026-08-06T05:59:15.988752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T05:59:15.622106Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.622106Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:39958fa2257f965d2ce3aa6444ba04969dad97d4642e3c4a62bf184ff3e7dece","observation_id":"bfc92a07-7475-461a-83ab-b3b935a2b4bb","resolution":{"observed_at":"2026-08-06T05:59:15.622106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T05:59:15.625916Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.625916Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:1d8ff5dee61ab57d9610c6efa091498bf83220a840079421f0315b8862c0ccdd","observation_id":"33c7eb08-1cfd-4758-a1b4-9805c31cf4a4","resolution":{"observed_at":"2026-08-06T05:59:15.625916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.975461Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":"d0a09c28-b32e-41b6-a36e-0df79fe95a20","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.629760Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:56c68dd29616b3779c03964ce216781873706547e22b4b377fd23839529f643d","observation_id":"96fecee6-52b3-4c19-86cc-d243bece0746","resolution":{"observed_at":"2026-08-06T05:59:15.978871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08240","last_updated":"2024-11-06T13:03:20Z","snapshot_observed_at":"2026-08-14T00:54:44.244536Z","submitted_at":"2024-09-12T17:39:23Z","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08240","snapshot_observed_at":"2026-08-06T05:59:15.632916Z","title":"Ifadapter: Instance feature con- trol for grounded text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.632916Z"},"links":{"cited_paper":"/paper/2409.08240","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:dd2e4354302f17387fc791ba94d5b32c857862d424c99ffec3c72c84ba5ce02f","observation_id":"20414764-bd0a-4c08-859f-ab2748069f4c","resolution":{"observed_at":"2026-08-06T05:59:15.632916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.963954Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"159c900a-c955-47ba-a8ec-2fdd927ea2ff","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.636548Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a198d2ca8f413516459d5875ee6b1fd780b9a09bedf0e1c3a11d1978e468966a","observation_id":"47190e2e-cb6f-487f-bcd1-6790ca4821e5","resolution":{"observed_at":"2026-08-06T05:59:15.968577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T05:59:15.639954Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.639954Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:fe8e6a96e5ff71c1eedf32d0eced7d74bbf6e2a311012c52b6d1dce6a4908f28","observation_id":"11966a8c-fafa-4e4c-96d9-89124b9e32c0","resolution":{"observed_at":"2026-08-06T05:59:15.639954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.953550Z","title":"Detclipv3: To- wards versatile generative open-vocabulary object detection","venue":null,"work_id":"ab8a3d4e-2fd8-4610-bf35-932bf14ad2c0","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.643455Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:8551b3178a3b0ccb3ec80098665e71144484432e5f7908fb62324da405e22523","observation_id":"022bea05-3bf8-41fd-8391-c2ac7527aef8","resolution":{"observed_at":"2026-08-06T05:59:15.957022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T05:59:15.646747Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.646747Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:3db8a956bf6a4408fd08930d88fcb1782589b852a72b813c8fceaaa5ca856eaa","observation_id":"75f515f5-2b13-4031-b42c-f47808b2960d","resolution":{"observed_at":"2026-08-06T05:59:15.646747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.650592Z","title":"Glipv2: Unifying localiza- tion and vision-language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.650592Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:16d5725134432614f2ab1e902c41c7594801161883bde3c53721be73b84d89e6","observation_id":"ecd1a846-9a9e-466a-abba-79e3f324ca89","resolution":{"observed_at":"2026-08-06T05:59:15.650592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.936938Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"0a389dc1-ffdc-4b96-8ec8-80ade075200c","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.654082Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:1d57a89858adae7f1f54024b33591f2c2be6620eacf47b834530b1e1d4ef7d3b","observation_id":"7288b7b2-a5be-45c4-afd7-53cb58ab7dde","resolution":{"observed_at":"2026-08-06T05:59:15.940870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06412","last_updated":"2024-04-13T01:40:03Z","snapshot_observed_at":"2026-08-14T14:34:20.200569Z","submitted_at":"2023-08-11T23:03:50Z","title":"Taming Self-Training for Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":"2308.06412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06412","snapshot_observed_at":"2026-08-06T05:59:15.693869Z","title":"Taming Self-Training for Open-Vocabulary Object Detection","venue":"cs.CV","work_id":"7dab7794-f09d-478a-865e-c9502c61abb2","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.657447Z"},"links":{"cited_paper":"/paper/2308.06412","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:79928bbe45c2205d5e06583c8ba86ec3b23020bc5f5afcd9da42d4b4181ecd3f","observation_id":"7edd6207-3e5e-40d8-8ede-308d5e5fdb1f","resolution":{"observed_at":"2026-08-06T05:59:15.700057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.926310Z","title":"Migc++: Advanced multi-instance generation controller for image synthesis, 2024","venue":null,"work_id":"6c0e0d39-63e1-458f-b1a0-e1d09baadc62","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.661112Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:5df589d18ebbd4a9b22d686a41ae4f2ab31267e2e2156eeec37bb385dd38736c","observation_id":"a440a126-4c4c-4fcc-bac8-52a6dfdd7968","resolution":{"observed_at":"2026-08-06T05:59:15.930189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.915814Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis, 2024","venue":null,"work_id":"d6277ae9-9253-4019-9498-d49a21c16512","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.664441Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:f14583b6d20a0234126f7485244c0c7c2dc8fc37e65541f4af2ca3a45de8b7b9","observation_id":"f78d3fea-f5e6-4e64-b566-b5aa1489c56c","resolution":{"observed_at":"2026-08-06T05:59:15.919475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.546496Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.546496Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:01823279b6aef37ec423550ea17bfe0b3f1158da8777de637c2fac4eb9fe14c4","observation_id":"13b8e0a3-f0bb-44e8-b3f7-b80e4667dd9b","resolution":{"observed_at":"2026-08-06T05:59:15.546496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:55:16.598034Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2508.01008."}