{"as_of":"2026-08-15T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00dbdacc0fdaada137616d20b930a30ef3292ae98b59931c9737385ea80257dc","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:03:29.034095Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:02:55.814289Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T07:39:50.478310Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16749","snapshot_observed_at":"2026-08-12T14:02:55.814289Z","title":"Anysynth: Harnessing the power of image synthetic data generation for generalized vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16752","last_updated":"2024-12-02T04:12:35Z","snapshot_observed_at":"2026-08-13T09:26:39.204208Z","submitted_at":"2024-11-24T05:27:21Z","title":"Imagine and Seek: Improving Composed Image Retrieval with an Imagined Proxy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:02:55.814289Z"},"links":{"cited_paper":"/paper/2411.16749","citing_paper":"/paper/2411.16752"},"observation_digest":"sha256:a730730a51f20e23136a304f2cf9a7e95965a03d52860ec4c63d4dca73c18c19","observation_id":"33eaaa53-e5a5-4bf7-b5de-37e8634de503","resolution":{"observed_at":"2026-08-12T14:02:55.814289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2411.16749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anysynth: Harnessing the power of image synthetic data generation for generalized vision-language tasks","venue":null,"work_id":"4c822625-8c9c-4021-b642-441e0964503b","year":2024},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-08-11T06:30:51.892484Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2411.16749","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:aff5c57386e0b3e6c7938846fb693e314e93d5d3c5a4541266742019ff4580f8","observation_id":"52e3cd3d-fc9b-450e-9da5-55576307077c","resolution":{"observed_at":"2026-05-15T07:39:50.480308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2411.16749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anysynth: Harnessing the power of image synthetic data generation for generalized vision-language tasks","venue":null,"work_id":"4c822625-8c9c-4021-b642-441e0964503b","year":2024},"citing_paper":{"arxiv_id":"2604.06870","last_updated":"2026-04-08T09:32:15Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:32:15Z","title":"RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T19:11:43.172296Z"},"links":{"cited_paper":"/paper/2411.16749","citing_paper":"/paper/2604.06870"},"observation_digest":"sha256:ee7b7a5a68cc61623ccc3abca530289502378b839c5235c3722675ba7b888cbb","observation_id":"01d80f55-4586-43b5-b625-b49aebed3ee0","resolution":{"observed_at":"2026-05-10T23:20:54.236052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16749/citation-record","integrity":"/paper/2411.16749/integrity","json":"/paper/2411.16749/citation-record.json","paper":"/paper/2411.16749"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T14:03:26.456495Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.456495Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:01867f572dd3d4a5de73f1a4f72721921c911d824c90da9e4249e6c3c8466f2a","observation_id":"c692dc30-8d04-46fc-bdb9-69b11c94c281","resolution":{"observed_at":"2026-08-12T14:03:26.456495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-08-14T15:56:28.920461Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-12T14:03:26.521824Z","title":"ediff-i: Text-to-image diffusion models with ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.521824Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:8187ff8234aa534037b8c4d859366e9767c0d3fe6f542e18273d2e418cadc785","observation_id":"05e9e2ff-15f9-4df0-9a12-3885a126b03b","resolution":{"observed_at":"2026-08-12T14:03:26.521824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:34.384839Z","title":"Zero-shot composed image retrieval with textual inversion, 2023","venue":null,"work_id":"5245e884-6c1b-4074-b6ad-eba83c0e800a","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.604774Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:8982d88c35845dc793dc34f5e631f71ab9558cdfcd5d8235f7a21ee596242fb1","observation_id":"12fd3cd8-e7a3-4c30-ac7b-2e13521fdd51","resolution":{"observed_at":"2026-08-12T14:03:34.462169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:26.623147Z","title":"Murphy, William T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.623147Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:b40648371f4d1c074531b79badb26034540f163b60bfeb2edc04ef50c1247df4","observation_id":"1fceac45-1586-4f64-9669-e0b3e690454e","resolution":{"observed_at":"2026-08-12T14:03:26.623147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03373","last_updated":"2023-11-29T10:21:48Z","snapshot_observed_at":"2026-08-14T07:18:32.762313Z","submitted_at":"2023-04-06T21:00:00Z","title":"Training-Free Layout Control with Cross-Attention Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03373","snapshot_observed_at":"2026-08-12T14:03:26.633424Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.633424Z"},"links":{"cited_paper":"/paper/2304.03373","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:7743126081d831b3985e65ce7276a7064d7669a93582279d43942ff4454e3e13","observation_id":"f9676e7d-26e8-41a9-ace2-ad83eeb116f1","resolution":{"observed_at":"2026-08-12T14:03:26.633424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:34.236691Z","title":null,"venue":null,"work_id":"d28352ac-f918-4871-be38-6726c4c6abbd","year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.696735Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:97da880dfc4786d0a3478b4443649a0ee7a473638a22aaae4d62466eb54b545f","observation_id":"30d5f4ab-e8c4-4845-80e6-4428c1afc9c1","resolution":{"observed_at":"2026-08-12T14:03:34.246347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:34.200346Z","title":"Auto cherry-picker: Learning from high-quality generative data driven by lan- guage, 2024","venue":null,"work_id":"5363ecbe-6a5b-44d8-8c7a-b53cf7cd12bb","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.821036Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:fc40f7d5940443bc56b7c6e91dc4914e7f13bfc6c0b069fc8401ad4348661a46","observation_id":"86fb60b6-fb77-4d46-ad0e-0327c9ca0e31","resolution":{"observed_at":"2026-08-12T14:03:34.207549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:34.148677Z","title":"Style injec- tion in diffusion: A training-free approach for adapting large- scale diffusion models for style transfer","venue":null,"work_id":"d8a76dc0-4294-4e62-b619-710f2e34ba1c","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.897043Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:8e74291e63a362e3a3f3a00558a18c83cfc47034549e87740e323c9cb657ac9c","observation_id":"57cbed7a-a7c8-4af1-95c7-dad21678ad53","resolution":{"observed_at":"2026-08-12T14:03:34.163509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:34.092906Z","title":"Roboflow 100: A rich, multi-domain object detection benchmark, 2022","venue":null,"work_id":"64927575-7d57-444e-985f-bb3390264905","year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.920948Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:fc947e46b4a9266e973ab59fd456e4c8d42b6816725a234978ef36d04651d84a","observation_id":"7fbaf30c-0d5d-4a4f-b529-a8115df8bdb5","resolution":{"observed_at":"2026-08-12T14:03:34.108061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:26.932515Z","title":"Diffusion models beat gans on image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.932515Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:4d2178939bf86c3bf9ccedea912fb06fb1e054c8b817bfa5d494df32fb5234fe","observation_id":"725a48ba-ac3f-4282-aa4a-a4760ac979ef","resolution":{"observed_at":"2026-08-12T14:03:26.932515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.995488Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":"d0428f25-0279-40ad-a053-60569367aa4e","year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.946007Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:7f481ed379b94481e2b3c0a7b5d437e6f4b628836c6fc8fa1a49b9ebb0e8ff2c","observation_id":"2b2d9cbc-24d2-422d-8402-23e9f07a5016","resolution":{"observed_at":"2026-08-12T14:03:34.027916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.855456Z","title":"Everingham, L","venue":null,"work_id":"ee1926c4-86ac-4daf-b06b-a3b2873bb164","year":2010},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:26.997032Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:0cad802da0dfc217705b819904652718fabecb3b0dd2fff1e0967c54f26241b6","observation_id":"4331ec7b-9037-4d7d-9f39-83d9892c0d0b","resolution":{"observed_at":"2026-08-12T14:03:33.890273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.088187Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.088187Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:2d1742bb52174f18ab93ccbfcae240ed3d69d5659c87c7a6ac9b68d5891e8327","observation_id":"3bfac62c-0fa0-45e1-b224-9716fe6e27ea","resolution":{"observed_at":"2026-08-12T14:03:27.088187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03094","last_updated":"2024-09-27T08:50:10Z","snapshot_observed_at":"2026-08-15T08:25:12.044838Z","submitted_at":"2024-02-05T15:25:32Z","title":"Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector","version":4},"cited_work":{"arxiv_id":"2402.03094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03094","snapshot_observed_at":"2026-08-12T14:03:30.491060Z","title":"Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector","venue":"cs.CV","work_id":"af976ade-703a-4943-b541-b1789f32b9e6","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.118808Z"},"links":{"cited_paper":"/paper/2402.03094","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:8f2b1bd2579ec28c0a53cf403088a7fc51acd601b23ac21d7aa574817e933477","observation_id":"4bb681df-7e46-47aa-895e-db80bd997c94","resolution":{"observed_at":"2026-08-12T14:03:30.502490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.715426Z","title":"Apollo home page","venue":null,"work_id":"a4abff93-eb24-42e0-8461-976e2e342128","year":2019},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.133870Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:5a958cbe5829b94dc1478b4ebc5716402374790c44fae24af9eda2c865bd7c00","observation_id":"b384a23f-7d64-4873-825a-a005b7c34e3d","resolution":{"observed_at":"2026-08-12T14:03:33.746541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-12T14:03:27.143840Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.143840Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:bdc783395bc2d2b3d5815c246baf6aac4742ede26b4fda4ade91b02e0d7ceb04","observation_id":"fc22c40a-94d4-4411-ab47-e9b6483d592e","resolution":{"observed_at":"2026-08-12T14:03:27.143840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.218020Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.218020Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:a606b15aef8b1a0069df819136f6cf522b6badb703ae4f9ec372ffdd6b6a6fc8","observation_id":"5d6d2f82-53ec-40de-b0ed-6d409125ef26","resolution":{"observed_at":"2026-08-12T14:03:27.218020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.597712Z","title":"Egtr: Extracting graph from trans- former for scene graph generation","venue":null,"work_id":"80d679e7-615f-4659-8492-e0c7ab4287cd","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.314114Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:bba74337dc531ff80bcfe5b30b8f7af0ee95284e5e6ad2c6b4a33d852ca1f1d6","observation_id":"b98fe489-8dcc-4ac2-9b0f-810d4a896028","resolution":{"observed_at":"2026-08-12T14:03:33.622574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.541686Z","title":"Cross-domain weakly-supervised object de- tection through progressive domain adaptation","venue":null,"work_id":"88c23a16-5fa1-4a86-875e-b3a933afb6e6","year":2018},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.331224Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:4bbf8bcf64459db479697fa7a6f201fd286da43d9b3fc7bfd3451e8cdaaf84c0","observation_id":"4fa718c8-11e7-49a5-9a2f-cc964bfb94a5","resolution":{"observed_at":"2026-08-12T14:03:33.556492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.485978Z","title":"YOLOv5 by Ultralytics","venue":null,"work_id":"e9954593-6b6f-41d5-81ba-17a11fd11a2e","year":2020},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.355230Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:9d46d6cf387bd14e2aed24ae48743e85bd5bded0cfe4bc1a4a9d1264f28dd023","observation_id":"9fea8582-4a9d-4cba-be0c-4c3f05fe742c","resolution":{"observed_at":"2026-08-12T14:03:33.502944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.401484Z","title":"FOCUS: Familiar objects in common and uncommon settings","venue":null,"work_id":"23ec6793-c80b-4620-82bb-82c1e1b4ffee","year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.371263Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:2e31ec893e92f60e14922a08166d1d02531f1b50583afd39cdaee238e59af484","observation_id":"0bd6db3c-721e-42d1-82a3-881ec9ed0645","resolution":{"observed_at":"2026-08-12T14:03:33.443212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-12T14:03:27.408609Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.408609Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:40a46da5a22b4ec0ab2ce882293997eef501549db5623ce1c4d2ecca302aaa78","observation_id":"d1e5a5f1-0f2c-4d5a-9c33-08189376a4d2","resolution":{"observed_at":"2026-08-12T14:03:27.408609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.471889Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.471889Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:d90bbac18e7f8700b60fa8d3590b086656f6ec5c9c777e4f671dc03f60a4f784","observation_id":"d990bf1c-0b0f-4314-8820-2da0ebba2b21","resolution":{"observed_at":"2026-08-12T14:03:27.471889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08790","last_updated":"2022-10-13T04:32:12Z","snapshot_observed_at":"2026-08-15T08:24:42.571791Z","submitted_at":"2022-04-19T10:23:42Z","title":"ELEVATER: A Benchmark and Toolkit for Evaluating Language-Augmented Visual Models","version":6},"cited_work":{"arxiv_id":"2204.08790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.08790","snapshot_observed_at":"2026-08-12T14:03:30.220429Z","title":"ELEVATER: A Benchmark and Toolkit for Evaluating Language-Augmented Visual Models","venue":"cs.CV","work_id":"3bc756f8-2062-4f7e-9e9d-f29db29f8d37","year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.535050Z"},"links":{"cited_paper":"/paper/2204.08790","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:bcc3fb7e5cff7ed2bd004675ad0be6325cb0f2e50a92ec0f5baecdaa18bee7ae","observation_id":"6604a584-c5e4-4b53-aa79-057edbbcdd07","resolution":{"observed_at":"2026-08-12T14:03:30.305941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.552055Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.552055Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:2ab974ef153848833d8ff0a76360d1cbac225b94eb311bcb60111c6fc7d61f70","observation_id":"94809d2d-bf34-453e-acf5-884c507b947c","resolution":{"observed_at":"2026-08-12T14:03:27.552055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.221213Z","title":"Grounded language-image pre-training","venue":null,"work_id":"32650faf-43cf-403a-9163-c4d4d1049391","year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.567422Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:b69502579b517e4376bc39f7ea9b0c3efeb9a2cd126766f1329af8ccce8332b7","observation_id":"672024d6-6fdd-40d0-b38d-b47ee26ff9a8","resolution":{"observed_at":"2026-08-12T14:03:33.259659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.580116Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.580116Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:c1e995ad4f971d6cd1b0f58d0f18f63819b5980e64aceadf0f35d4c66e018033","observation_id":"8e810f95-7c1a-4a0d-9de2-aa8f2c5990a1","resolution":{"observed_at":"2026-08-12T14:03:27.580116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16752","last_updated":"2024-12-02T04:12:35Z","snapshot_observed_at":"2026-08-13T09:26:39.204208Z","submitted_at":"2024-11-24T05:27:21Z","title":"Imagine and Seek: Improving Composed Image Retrieval with an Imagined Proxy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16752","snapshot_observed_at":"2026-08-12T14:03:27.632029Z","title":"Imagine and seek: Improving composed image retrieval with an imagined proxy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.632029Z"},"links":{"cited_paper":"/paper/2411.16752","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:e85200578a2e9f929d79f62ee6e206cc928a0a7b0ac0782408ffcdc7240c0fc8","observation_id":"b6400b1a-6787-4076-92df-1fd2960d76d1","resolution":{"observed_at":"2026-08-12T14:03:27.632029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.698541Z","title":"Caphuman: Capture your moments in parallel uni- verses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.698541Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:b84d59f28bbecc21949177ff1020b4f8206a0cc0cb7f1fd9f2e0122e0665406e","observation_id":"a757d1eb-0aec-482d-88ec-ae79e205b068","resolution":{"observed_at":"2026-08-12T14:03:27.698541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.083262Z","title":"Lawrence Zitnick, and Piotr Doll ´ar","venue":null,"work_id":"cc707269-c746-49c6-8ad1-79338322ac97","year":2015},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.720318Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:2fcec8fd6a8e315abb629b0e030bc7d32aa60b8b4d7f08de30c52bea6d4985ad","observation_id":"d680e15a-5900-426e-a21e-67303e07ebca","resolution":{"observed_at":"2026-08-12T14:03:33.093601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14584","last_updated":"2025-05-25T14:34:05Z","snapshot_observed_at":"2026-08-15T08:24:57.518617Z","submitted_at":"2024-08-26T19:09:13Z","title":"DIAGen: Semantically Diverse Image Augmentation with Generative Models for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14584","snapshot_observed_at":"2026-08-12T14:03:27.739980Z","title":"Di- agen: Diverse image augmentation with generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.739980Z"},"links":{"cited_paper":"/paper/2408.14584","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:9670cf58d15d9f75f423da49b184981a5f6b04f0101028521eb2c44b8e6d141c","observation_id":"868fa835-a716-4f6f-9411-8aee9c97ffde","resolution":{"observed_at":"2026-08-12T14:03:27.739980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:33.017425Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"d5c06dfd-3c2d-41ca-9b46-a2f942d4cc90","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.755471Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:fb3eae6fac77618e5c3e4f62e4bdd6058d8ee233969cc394083041f03672c71f","observation_id":"02d73e1a-f0b5-413e-afc0-d045992f6ac3","resolution":{"observed_at":"2026-08-12T14:03:33.033757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.823858Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.823858Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:ab476142cfc1e25e31e4a3e0359b423e9bcb0796e6ab97869b0009f6a719838f","observation_id":"68a6655e-c7ba-48c1-9842-8fd608740192","resolution":{"observed_at":"2026-08-12T14:03:27.823858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.883139Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.883139Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:d2fb0691dfe785172ef3083a461db5a51f1a042ab7f2fb0f6c9dc2abe6858c8c","observation_id":"8906a387-71f8-44dd-805b-c5b6a8bf93a2","resolution":{"observed_at":"2026-08-12T14:03:27.883139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T14:03:27.893766Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.893766Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:4fd16b272bd37ef0b319e3b06af9046f9b5eb949ccb902326bbee40dc68dcca9","observation_id":"6cccad7c-37c5-4f6f-89c5-8a0898859cbd","resolution":{"observed_at":"2026-08-12T14:03:27.893766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.881827Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"761da5da-cc0c-4f5c-b4a3-4afaa6ed24ad","year":2021},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.902034Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:8cc0c58e216c7d2640af3d1abcadb9f133bfd4d649fe9d32386e1fd66cdeaacd","observation_id":"c0510e0d-9415-4383-9f60-4f2291ab2036","resolution":{"observed_at":"2026-08-12T14:03:32.897542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-15T06:14:43.077450Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T14:03:27.913396Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.913396Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:64f4e09ba8fa236a476e2a9d81e77c8f44dc818a4a7555bbc1da57e046ea7a86","observation_id":"92301f46-ef64-48b7-b9d5-80f8c10b6a9f","resolution":{"observed_at":"2026-08-12T14:03:27.913396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:27.993872Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.993872Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:fef2088a9e6cf4d86532ffb7b9a916fa059547f75ee406718329f445fbabbc23","observation_id":"f5d3620f-a2bc-4caa-9616-117ccdcbcb9b","resolution":{"observed_at":"2026-08-12T14:03:27.993872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.804290Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"ba181211-7e53-435e-adf0-3f992c899b1b","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.072563Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:ca95ef642c42343b57b7832d5e2cce932324b83ec023a78f596d029e1337adaf","observation_id":"9081faca-b818-44b1-80a7-f9976f73494b","resolution":{"observed_at":"2026-08-12T14:03:32.819405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.686960Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"cf4828c6-33ea-44eb-bf63-864ecb3c5d5a","year":2021},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.098326Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:0411259722140e0e1eec68e3e252ba01630f29c14d2858a214b5df560358fb0f","observation_id":"b9b9f30c-02a5-4ecf-8ea5-926de6c119f0","resolution":{"observed_at":"2026-08-12T14:03:32.753579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.566776Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":"cf51837a-f3c5-4a30-96bf-f8a9d67fcb0b","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.105091Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:c24bf1abecd4dd6db3c9fb36e4d04fa9068660f7d5a021bdfa2d3b0f242396da","observation_id":"77bdaf5e-5f3f-411d-a735-ea8d85940848","resolution":{"observed_at":"2026-08-12T14:03:32.583296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.541095Z","title":"Generative ad- versarial text to image synthesis, 2016","venue":null,"work_id":"b6c2fddc-553c-456a-8e9c-29ddb10ff2d0","year":2016},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.125663Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:657a9f340ef9f938fcf63bba3c95b7041ab845d0d483c467f96fa917a0987ec3","observation_id":"87495f66-569f-4ae2-9092-b39838d75d2b","resolution":{"observed_at":"2026-08-12T14:03:32.547836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:28.225160Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.225160Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:d108068035bd1e2f1a488a2a5bc24affe0cba1356bb0f793d70d937accd4434b","observation_id":"1d5a05aa-53b5-45ad-a7fb-bb717b5f2590","resolution":{"observed_at":"2026-08-12T14:03:28.225160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-14T05:43:53.421538Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-12T14:03:28.276830Z","title":"Ronneberger, P.Fischer, and T","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.276830Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:cfafdfa2fdad1893355ef037fef984badca4f250baf3c441d1bc3e638fa7f54b","observation_id":"b9275d70-af62-44e8-a70a-15ef44e87a99","resolution":{"observed_at":"2026-08-12T14:03:28.276830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:28.311524Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, Seyedeh Sara Mahdavi, Raphael Gontijo Lopes, Tim Salimans, Jonathan Ho, David Fleet, and Mohammad Norouzi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.311524Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:38dd1a72241d6718d9447dbdb3b1e88d2ada5b0b4605188383be1cfbb20d41de","observation_id":"66b0a1ed-7dc2-46f1-b642-0a0b7da3ce48","resolution":{"observed_at":"2026-08-12T14:03:28.311524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T14:03:28.325435Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.325435Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:6a370c1ae3d7ef17161c15cc04767d32587d93c68bd24362c8118b1739b70822","observation_id":"05aeeb2c-1ae7-460e-b985-211d8ff29cea","resolution":{"observed_at":"2026-08-12T14:03:28.325435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.326867Z","title":"Gen2det: Generate to detect, 2023","venue":null,"work_id":"066f192f-ab30-4ab9-983c-84d5863a8d09","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.335230Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:059fe618414bd9be1e0801a45e31f201bb1658dcfdaae08a5a3a17320e9f8f25","observation_id":"e2ac4473-ffae-4975-bfb9-b9eb4824860e","resolution":{"observed_at":"2026-08-12T14:03:32.384266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.250720Z","title":"Effective data augmentation with diffusion models, 2023","venue":null,"work_id":"841e40ec-4621-4460-b803-1e43dde6bb16","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.344898Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:1600f4fa6562bccfde5178ee357dc56ab48a9e102cbd7938e421e5671967d049","observation_id":"44feffb4-403d-4823-a13d-286d07063256","resolution":{"observed_at":"2026-08-12T14:03:32.267410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:28.356046Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.356046Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:504f4dca4ebddb6934b8d1e6c286c329c1e0db75f5ff237bcbab816b61ac03f1","observation_id":"630417ef-43f3-4def-bb5e-3f5a037b4189","resolution":{"observed_at":"2026-08-12T14:03:28.356046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.145844Z","title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","venue":null,"work_id":"0193adcd-a7b4-41c4-9e44-e9cb8a8fc726","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.366056Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:98614db8ffbf4fdf233cb7843a06c3fbfdba1a1b5bc2860cb4eb4a1691ce1d14","observation_id":"0c230471-ae9e-4077-bead-c08e9c77ba6b","resolution":{"observed_at":"2026-08-12T14:03:32.170435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:32.056511Z","title":"Learning from synthetic data for crowd counting in the wild, 2019","venue":null,"work_id":"2644d3b1-6e15-439b-95af-b6bda513cb0f","year":2019},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.414014Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:88b8f3d2b2cf8ef092c1b0ae8ebb36547b49f23e5fc9f9dd9e0c89bf45c587fa","observation_id":"a2c6d3a8-2416-485a-a91f-d8128744806a","resolution":{"observed_at":"2026-08-12T14:03:32.106032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:28.493864Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.493864Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:ca2a48b550c0555418cfeab9af034421b63d5a316836d39988740e681bca5c6a","observation_id":"d2519556-a068-41a8-b835-fa463d309491","resolution":{"observed_at":"2026-08-12T14:03:28.493864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.817494Z","title":"Fine-grained prototypes distillation for few-shot object de- tection","venue":null,"work_id":"dd3ed9eb-a0ae-4944-92bf-b1a36bb8182e","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.533632Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:e74325ae8c224ba3c450a391fb9333e8a1e283c1027ebb679eda22e0c3971820","observation_id":"514d7a75-729a-4785-8607-2ed0d3bb1d8b","resolution":{"observed_at":"2026-08-12T14:03:31.893574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-14T13:38:46.864104Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-12T14:03:28.547482Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.547482Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:783da23f86a338dc1d782d6bf9550c1ecb64a8f6817ecc6ca574624196014652","observation_id":"6cdd4fc8-b4e4-4bd1-b7d3-b37a6a950138","resolution":{"observed_at":"2026-08-12T14:03:28.547482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.604592Z","title":"Cashman, and Jamie Shotton","venue":null,"work_id":"af02dba3-7a2a-4dfd-9ce2-283850098d4a","year":2021},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.557863Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:b81a5058213eab77a220ddf11a6d45c9b1085cc2ad470e13d734b7d1fbe31a0a","observation_id":"097caa9f-a2f3-4d66-80f5-74b614ede8d3","resolution":{"observed_at":"2026-08-12T14:03:31.688006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-12T14:03:28.567989Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.567989Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:fa135ed7a89276a1a7c933a160c89c4619bde081f1deb12d170e032f4b12af8d","observation_id":"1fcc220b-2b9f-48d7-b0a9-9b329eaf17c0","resolution":{"observed_at":"2026-08-12T14:03:28.567989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10816","last_updated":"2023-08-21T13:07:10Z","snapshot_observed_at":"2026-08-15T08:25:08.530413Z","submitted_at":"2023-07-20T12:25:06Z","title":"BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10816","snapshot_observed_at":"2026-08-12T14:03:28.583234Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.583234Z"},"links":{"cited_paper":"/paper/2307.10816","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:400962faa58f01f1d3efa315899c5b7d9d6541c2ed2d8294ee60679cfc7c8a96","observation_id":"5a1387d4-dfc1-454c-b7a9-08eb179b69c8","resolution":{"observed_at":"2026-08-12T14:03:28.583234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.555314Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation, 2023","venue":null,"work_id":"796f6227-baad-4191-82ca-8c443e0fffdd","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.597956Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:412720323a1d79730a56c2cd7d5a7b2442b905a19019986ff65686268b5a82ca","observation_id":"a2c6a7ab-555b-45ce-ac4b-dc398d456c8e","resolution":{"observed_at":"2026-08-12T14:03:31.579976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.512970Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks, 2017","venue":null,"work_id":"186ed5b1-a099-495a-bcdd-c35c653d4c17","year":2017},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.614952Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:ddb659163ee0600b887f9ca4fd7421f12d5278141a4e2843299ad4bb961e7da3","observation_id":"f36b568b-2786-4b0d-ab84-207ac6ce8456","resolution":{"observed_at":"2026-08-12T14:03:31.525743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.448404Z","title":"Ldre: Llm-based divergent reasoning and ensemble for zero-shot composed image re- trieval","venue":null,"work_id":"fbe84666-ff31-4aef-9b9c-4023e1f06410","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.652368Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:572015e1d66493332a2f7a3ae94fd2010e4dea03c83b89cfe8d0a7009442fdb2","observation_id":"6a75bd0a-58ae-4df3-b0bc-088e5495643f","resolution":{"observed_at":"2026-08-12T14:03:31.491714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05836","last_updated":"2022-10-11T23:27:03Z","snapshot_observed_at":"2026-08-15T08:24:58.959252Z","submitted_at":"2022-06-12T20:31:28Z","title":"GLIPv2: Unifying Localization and Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05836","snapshot_observed_at":"2026-08-12T14:03:28.738271Z","title":"Glipv2: Unifying localization and vision-language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.738271Z"},"links":{"cited_paper":"/paper/2206.05836","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:1024dfaa3108e295d117e935c0097c4acf2b4926d0c53bd7d90fda24f92aa239","observation_id":"cefe5213-571d-4075-85e9-fa4563dec278","resolution":{"observed_at":"2026-08-12T14:03:28.738271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.270004Z","title":"Dynrefer: Delving into region-level multi-modality tasks via dynamic resolution,","venue":null,"work_id":"2e678816-d1f6-445b-b58a-c3348ed33f09","year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.819762Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:0269810c95c1ffe4ae69f2de7c14ce40806e09163b2544720fd59aed180b77d0","observation_id":"12682082-1eb5-40a3-bdd7-f5849f50a3a0","resolution":{"observed_at":"2026-08-12T14:03:31.327190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.210323Z","title":"Layoutdiffusion: Controllable diffu- sion model for layout-to-image generation","venue":null,"work_id":"ef47fc41-f94a-43e8-a5a4-9bb0e41339c0","year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.842953Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:e60c00e131cdc2495e38cab135ca816ced0a3511fdc665692d46037c26a465f7","observation_id":"cf6ff3b9-0cc2-4568-b37e-683e08f0dc1c","resolution":{"observed_at":"2026-08-12T14:03:31.221819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10028","last_updated":"2023-05-17T08:15:45Z","snapshot_observed_at":"2026-08-15T08:24:43.210558Z","submitted_at":"2023-05-17T08:15:45Z","title":"Pyramid Diffusion Models For Low-light Image Enhancement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10028","snapshot_observed_at":"2026-08-12T14:03:28.852307Z","title":"Pyramid diffusion models for low-light image enhancement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.852307Z"},"links":{"cited_paper":"/paper/2305.10028","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:7742c72bc9291464ce8a483353feae86f0a803804baffa1352df3e58e0f0736b","observation_id":"276af15a-9816-481e-b84d-d75d68c2fa70","resolution":{"observed_at":"2026-08-12T14:03:28.852307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.170186Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis","venue":null,"work_id":"7d132421-488b-40a7-90bd-dcbd730b9933","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.864617Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:582197a91f9b558f3d5602be8f92903fb9944eac04e774e7454c25a0785d3903","observation_id":"f14d6669-2162-4006-80e6-e51d6e6be41b","resolution":{"observed_at":"2026-08-12T14:03:31.185926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02329","last_updated":"2025-05-05T02:03:50Z","snapshot_observed_at":"2026-08-15T08:24:42.089700Z","submitted_at":"2024-07-02T14:59:37Z","title":"MIGC++: Advanced Multi-Instance Generation Controller for Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02329","snapshot_observed_at":"2026-08-12T14:03:28.875664Z","title":"Migc++: Advanced multi-instance generation controller for image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.875664Z"},"links":{"cited_paper":"/paper/2407.02329","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:d763b6609deb40eadf471fa03d1b0e2ea6051a148ee1ed81a8c125a519c14bc1","observation_id":"f09b7ed7-b6f1-431f-b1df-c58e619096fb","resolution":{"observed_at":"2026-08-12T14:03:28.875664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:28.932870Z","title":"3dis: Depth-driven decoupled instance synthesis for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.932870Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:0bcb52eb37cf92566469b50658bddc852c8b2ea93739fe58c68ec31646ac13b6","observation_id":"7caf1579-74f0-4b62-9afd-110d02338df8","resolution":{"observed_at":"2026-08-12T14:03:28.932870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:31.092847Z","title":"Odgen: Domain-specific object detection data generation with diffusion models, 2024","venue":null,"work_id":"b06cdd54-8b15-40a1-a1ab-9e91c3659479","year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.970830Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:7deb76fb000df5ab3cdd7f53b7f119763a302aedd0e95b0ab16265fec57a13fe","observation_id":"220c78ab-c58c-4ee3-824c-44ce1abc0362","resolution":{"observed_at":"2026-08-12T14:03:31.111447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:30.991675Z","title":"Imagine a basic scene, including whether the scene is near or far, and give a scene label, such as on the grass or in the hospital","venue":null,"work_id":"2382b70b-9ad6-4cc7-83a2-4a3aa0566106","year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:28.990852Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:771e27ee473fd96755d13c65ff7b0dd12649e218dd6663085379636c931b0f64","observation_id":"8770c905-370a-4bcc-b38b-b0fb47b48218","resolution":{"observed_at":"2026-08-12T14:03:31.051485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:30.858530Z","title":"users may provide reference images and modify the content of the reference images","venue":null,"work_id":"d1fdc0e9-63bc-4eb9-b9e5-6511c1fc06a3","year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:29.010667Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:efb1a13cc1e34ae8bf70e03f5061cd1bd511729a7906aa2735dbd20813b274ff","observation_id":"9d62d14f-82bd-46ae-9124-c91781b2037c","resolution":{"observed_at":"2026-08-12T14:03:30.904796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:30.778718Z","title":null,"venue":null,"work_id":"3c39ccca-f51b-423e-b81b-adddd4a6785e","year":null},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:29.025215Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:947e6d289552e0a13311d6a2e51852228e9433f824c2e60035491f013090bf59","observation_id":"95af2ccc-a133-4f01-aef9-57dc3d639933","resolution":{"observed_at":"2026-08-12T14:03:30.813039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:03:30.725925Z","title":"Summarize output in format: … Make sure that each layout contains only one instance","venue":null,"work_id":"585175fe-2393-4b0a-aef7-d3044c7a307b","year":2017},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:29.034095Z"},"links":{"citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:70d2790535fdc0016e4a3767afd11fc45177b26e03cb17b0737e736decbadf6d","observation_id":"8a5bc7cf-b773-40af-9680-26cedd6cc491","resolution":{"observed_at":"2026-08-12T14:03:30.744950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T13:38:51.249990Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 3 inbound Pith citation observations for arXiv:2411.16749."}