{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:947177866ef15d6d0c52e09990e8445b4f5af803732d68e8d128852da274eace","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:44:18.490290Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:47:10.728416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.706550Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-04T06:47:10.728416Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation.arXiv preprint arXiv:2508.09987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.728416Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:8a4d9f39ebf37ffd4ac43e92a735a99e5775daeccf8f8e8a0dddca4f51b87f47","observation_id":"930cac71-df1c-4ade-85a8-a73f533250b2","resolution":{"observed_at":"2026-08-04T06:47:10.728416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2512.07348","last_updated":"2026-04-28T10:02:14Z","snapshot_observed_at":"2026-08-06T12:32:11.849043Z","submitted_at":"2025-12-08T09:40:11Z","title":"MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T00:20:58.483350Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2512.07348"},"observation_digest":"sha256:62ca600221b5b9ac8d51f40e874549a85a116c6926ffe99eadb3840ada32f298","observation_id":"9077d993-71cf-4d75-a590-62ba585e9563","resolution":{"observed_at":"2026-05-17T00:21:23.408189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-02T23:52:41.711567Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:5ee41a58ee4b94b49c54947a03c16c79d02893adc396630c9d1eed40dd2e8512","observation_id":"ee11affc-1452-4348-b2b3-13d6e7e85949","resolution":{"observed_at":"2026-05-16T08:10:45.467647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T13:00:22.875471Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:5468c964147533e0fb14a78c154ce0e5b7d66e13c989adf16746cb928d81375d","observation_id":"3727f093-580b-42bd-b965-57a7b0d45c8e","resolution":{"observed_at":"2026-05-21T13:04:10.562099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-03T03:50:46.874348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:46.874348Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:cefc3c0765a3fb7da1a6bb546ffaf66e4dc6f35b4ca085fd51eefbf2efa43093","observation_id":"4b0d842f-3bb5-43bd-b628-7734f017fe59","resolution":{"observed_at":"2026-08-03T03:50:46.874348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-02T18:25:58.290824Z","title":"Echo-4o: Harnessing the power of gpt-4o synthetic images for improved image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-07T15:25:42.104111Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.290824Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:4aacb1501a97be11c8f74222d337fab636a54a8ea24826bda4ab908445629a69","observation_id":"431cceef-dc42-4ef3-a2e3-06fdd4459c29","resolution":{"observed_at":"2026-08-02T18:25:58.290824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.17021","last_updated":"2026-04-18T15:09:01Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T15:09:01Z","title":"LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:41.483427Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.17021"},"observation_digest":"sha256:134f2a215940b122b2458f7a2a2f085630ac2288e735c64889e4b042b061a35f","observation_id":"87d8668a-d32e-40c4-b5ad-1c8834f1d5ef","resolution":{"observed_at":"2026-05-10T07:21:55.099717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.17736","last_updated":"2026-04-21T07:54:44Z","snapshot_observed_at":"2026-07-06T23:04:46.497227Z","submitted_at":"2026-04-20T02:49:32Z","title":"IncreFA: Breaking the Static Wall of Generative Model Attribution","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T05:35:46.381465Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.17736"},"observation_digest":"sha256:23b8d974dd4b0d6d0c1f60fd85e554d5fb32dfcf10306b11a7c5e2cf28e713fb","observation_id":"578ef19e-c334-4815-b475-25e8afa0b1a0","resolution":{"observed_at":"2026-05-10T05:36:01.504198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:a00df2446cc6b6e06fe1dd52c0396b1b2a07a1b94e83dc87a469ded4366f4b01","observation_id":"3d432ef3-d8fb-47df-b223-a5d3b74ead1e","resolution":{"observed_at":"2026-05-10T09:28:39.636695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.20796","last_updated":"2026-04-22T17:20:42Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:20:42Z","title":"LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T00:49:38.156237Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.20796"},"observation_digest":"sha256:4b767ac9870d50075e33893bcd6df205d328a73a34e0d3972a69c4a51fbe85ef","observation_id":"3eec311c-890e-447f-aa40-f6e2275e829d","resolution":{"observed_at":"2026-05-10T00:49:48.357764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.02567","last_updated":"2026-05-04T13:19:18Z","snapshot_observed_at":"2026-08-01T04:32:00.116261Z","submitted_at":"2026-05-04T13:19:18Z","title":"Automated In-the-Wild Data Collection for Continual AI Generated Image Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T19:00:45.628715Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.02567"},"observation_digest":"sha256:96770536c409a2ea0d72c7861ed86cbb51637e2c47e01cb2d2979f00e7c050f9","observation_id":"04c45296-5970-461d-b729-da28578ca476","resolution":{"observed_at":"2026-05-09T06:05:35.272848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.04503","last_updated":"2026-05-06T05:12:41Z","snapshot_observed_at":"2026-08-02T14:20:11.154625Z","submitted_at":"2026-05-06T05:12:41Z","title":"DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:56:47.621050Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.04503"},"observation_digest":"sha256:994938390085ae927535242c99c6fcb155f4f8d67ce670163212081b97fd7a13","observation_id":"a69c4dbc-3e41-46e2-8883-0988202182e8","resolution":{"observed_at":"2026-05-09T06:55:44.257603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:a4f9202bc8a927a7a67fc73319a87eccd6fb182a71ce415305ff75fa5c819d87","observation_id":"e6f3e836-e3b6-44dd-b520-5a428ec346ac","resolution":{"observed_at":"2026-05-13T07:32:29.604208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:664db861034689baab24896e4dbdea9d6677171dcb9b1ed6a317b698dd78e6e5","observation_id":"5a634008-15f1-4d99-9bdb-a99ff3c88d2d","resolution":{"observed_at":"2026-05-13T01:47:04.888423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:53:21.851578Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:6b4b1a18056f16e4f1adb8f59d408f7b158f728b1b28e5d426b1bf267a0f5ca9","observation_id":"9cb5b6af-48b2-49d6-8066-3d516d37c56f","resolution":{"observed_at":"2026-05-13T06:02:23.959544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T22:00:01.349754Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:a133ceaba8c7313a41c850556a974ba3a7a8a5bb64a2cac47ef4e64dd49cc3b3","observation_id":"8b878cdd-2cd2-48db-8273-c4b711f3440d","resolution":{"observed_at":"2026-05-14T22:03:03.420134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.12305","last_updated":"2026-05-12T15:54:49Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:54:49Z","title":"Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T05:48:04.997796Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.12305"},"observation_digest":"sha256:7508963d218902752f0d7274ff902161df13d879859ba9e9129c18ac70dc6367","observation_id":"9f65ce3f-0c10-407a-ab3a-167a1e28387d","resolution":{"observed_at":"2026-05-13T05:52:22.717435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:187a324178a6549cc9eb2d56d2f9830fbea74898b3349253d7ffbfc43c2d6491","observation_id":"d80e7656-d23a-42e3-8b1d-56b62a9a65ae","resolution":{"observed_at":"2026-05-15T02:13:30.544636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:a143a03963eeae677a62ffd987f939c9c49ee97958a162c89738cc21fdb1d9b1","observation_id":"7b84827b-75db-4d6c-856e-0c62ab14ec03","resolution":{"observed_at":"2026-05-19T16:37:39.705633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-02T11:48:01.614885Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:85c47e96398218c8ec524c02bac2941b9878690deebb5e967ea970d97d3b1d01","observation_id":"22edd390-9aec-43c3-90e6-85f988829d6e","resolution":{"observed_at":"2026-05-21T05:19:39.346678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.23518","last_updated":"2026-05-22T11:33:43Z","snapshot_observed_at":"2026-08-02T17:55:38.256248Z","submitted_at":"2026-05-22T11:33:43Z","title":"VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-25T04:21:05.811662Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.23518"},"observation_digest":"sha256:a3f2c4b400e1a4fc782df61e3e7fa3cdfd23284bef1c3e0d178e3a2456cb115e","observation_id":"820dacfe-2939-4c1e-835f-8d8cdf1b3416","resolution":{"observed_at":"2026-05-25T04:25:19.730880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.30062","last_updated":"2026-05-28T15:13:31Z","snapshot_observed_at":"2026-08-09T09:23:03.040130Z","submitted_at":"2026-05-28T15:13:31Z","title":"FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T07:59:44.436264Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.30062"},"observation_digest":"sha256:01bd3b1885353af26743317c76388fee95a53e0576834595f734fd1528adcc9b","observation_id":"c0059742-8e6d-4142-a723-dbbc63bd864c","resolution":{"observed_at":"2026-06-29T08:03:14.105435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:54.292448Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.30248"},"observation_digest":"sha256:35925538b6629fea0f9a035bfcbf4dbebda6efe5fb1dad5535ed39469d179561","observation_id":"d90f1426-8151-49e6-9048-e1ba002e6484","resolution":{"observed_at":"2026-06-29T07:43:13.991999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.03243","last_updated":"2026-06-02T07:04:51Z","snapshot_observed_at":"2026-08-02T20:02:29.970136Z","submitted_at":"2026-06-02T07:04:51Z","title":"MemoGen: Can Past Experience Improve Future Text-to-Image Generation?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:18.630777Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.03243"},"observation_digest":"sha256:d965188acead194bad19b704239d2cd95519365d094d4e1bd4e6ec60de186ce1","observation_id":"c4e0c9e5-a423-4714-88cd-6dd7da9438c5","resolution":{"observed_at":"2026-07-02T02:36:27.150642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:ce9cacd72231e31b9b0f00534541edf5b5d04958d40012061cca24a77a964ec7","observation_id":"abf57ffa-361c-4e17-9e30-b478241da339","resolution":{"observed_at":"2026-07-04T16:39:58.135045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-07T10:26:25.230801Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:56a9c74c5a278214714969e36b4f7507fffd7b1555f962eed23f68784ce5f41f","observation_id":"560ea876-8511-4e1e-867e-76970259df4b","resolution":{"observed_at":"2026-07-04T21:10:09.708346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.26907","last_updated":"2026-06-26T14:10:09Z","snapshot_observed_at":"2026-08-07T03:18:39.904639Z","submitted_at":"2026-06-25T11:40:12Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:19:21.433049Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.26907"},"observation_digest":"sha256:59d854c7f69e77210adbc0882782753456e2eecc9c53754d418cf7e950e3679c","observation_id":"f3feccb5-939d-4652-a186-3fb74814f15f","resolution":{"observed_at":"2026-07-04T13:19:50.702108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.26907","last_updated":"2026-06-26T14:10:09Z","snapshot_observed_at":"2026-08-07T03:18:39.904639Z","submitted_at":"2026-06-25T11:40:12Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T04:58:40.065005Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.26907"},"observation_digest":"sha256:bfcdf18785f3f3c5109da60d08daf25ccaa1ebdcf4fdfe8031ffe44ff27ba902","observation_id":"f665122f-5ab2-4958-a065-9e5e97710d82","resolution":{"observed_at":"2026-06-29T19:03:52.050125Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-02T12:26:27.389877Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:9723c2e2e6e8f32acfe4acd7b9499d9d115dc237929b3d7bbf71e3a235527494","observation_id":"4bc666a7-0f71-40ba-82a3-fcba477715e7","resolution":{"observed_at":"2026-06-30T06:54:20.742715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:91195f64e006dce7166cfd2a4e159890ed4fca32c0d07f7c5344d4286812a2cf","observation_id":"d10be50f-ff23-4c43-9fd5-9c5543cfb045","resolution":{"observed_at":"2026-07-01T10:05:40.288631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T22:47:42.650721Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15619","last_updated":"2026-07-20T04:43:29Z","snapshot_observed_at":"2026-08-06T18:01:16.811025Z","submitted_at":"2026-07-17T04:35:36Z","title":"StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T22:47:42.650721Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.15619"},"observation_digest":"sha256:95fb92f828c16ef0d6b8f032f621431d10b1287f3a05988bff6a50ccd3525356","observation_id":"6d962e50-6fa4-47a8-9724-bb4ce6867b2d","resolution":{"observed_at":"2026-08-01T22:47:42.650721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T12:46:26.424119Z","title":"Ye, Y.; He, X.; Li, Z.; Yuan, S.; Yan, Z.; Hou, B.; Yuan, L.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19341","last_updated":"2026-07-21T17:59:02Z","snapshot_observed_at":"2026-08-08T15:14:49.644541Z","submitted_at":"2026-07-21T17:59:02Z","title":"ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T12:46:26.424119Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.19341"},"observation_digest":"sha256:1afe1f41205cdcd5bb0b944359f3a6eb31f5ffe925c85110fd066c8b56420b00","observation_id":"a22c9aec-68da-4707-8639-adf7a373f25f","resolution":{"observed_at":"2026-08-01T12:46:26.424119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T02:14:09.772449Z","title":"arXiv preprint arXiv:2508.09987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.772449Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:cd80aa5fe1e3b35678b88857e41ce360dc5a584ab4532d4f3237fa05b8ea6ef1","observation_id":"e6e8cc14-ba48-4b0f-8e93-6b5832611c76","resolution":{"observed_at":"2026-08-01T02:14:09.772449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-30T18:58:28.496196Z","title":"arXiv preprint arXiv:2508.09987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26860","last_updated":"2026-07-29T12:44:19Z","snapshot_observed_at":"2026-08-06T09:28:43.159690Z","submitted_at":"2026-07-29T12:44:19Z","title":"Amortized Moment Matching for Visual Generation","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-07-30T18:58:28.496196Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.26860"},"observation_digest":"sha256:fd7aff7a580e2e0524f6c7107eb7a81cca6b702939b77bcb8f2b006760ee5bc4","observation_id":"e2f9fab1-341b-4ec4-b735-2dbbf7c15ceb","resolution":{"observed_at":"2026-07-30T18:58:28.496196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09987/citation-record","integrity":"/paper/2508.09987/integrity","json":"/paper/2508.09987/citation-record.json","paper":"/paper/2508.09987"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.478127Z","title":"Lawrence Zitnick, Devi Parikh, and Dhruv Batra","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.478127Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f792ea66e575c8c1e546730bad46adaaddc7aba4fa52ae8455a3fb4e37d75e77","observation_id":"8617fb45-85f5-4cac-b6d2-2f2376b89421","resolution":{"observed_at":"2026-08-05T20:44:10.478127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.536355Z","title":"Sd3-medium","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.536355Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:63c89cde8121c786c0c0bc1dfe362eccbff7031cb77a764deef2d4a5e9986846","observation_id":"971a41a5-30bb-4562-b464-0237a213c23b","resolution":{"observed_at":"2026-08-05T20:44:10.536355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T20:44:10.622883Z","title":"Qwen technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.622883Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e88e8e1f196ec40a47b8f2feb6124572557e96ec9f7886d009588fa53ab690fe","observation_id":"97555354-04a7-49f3-9c76-1e9d20533c84","resolution":{"observed_at":"2026-08-05T20:44:10.622883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T20:44:10.688300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.688300Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7ebd7fe2ca0976bfb0eeaec8457fd404f05536604f9c05b7a8f962a24b32c31f","observation_id":"b99b6dda-b6a7-4f10-985a-3a24a173b7f9","resolution":{"observed_at":"2026-08-05T20:44:10.688300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.745556Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.745556Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:bcb976be51cb6b39b094003a1026f42474cd0054d6cdf14fcadd634d02115cb3","observation_id":"f773e167-5a88-44cd-be4e-e7ebc581fa0d","resolution":{"observed_at":"2026-08-05T20:44:10.745556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.827910Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.827910Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:53611be0be42b7866984564aca2dc5c913dcfc4c2905f6148be62fc1909eda84","observation_id":"34d256f9-ab71-4f3d-a38d-cc6df7905906","resolution":{"observed_at":"2026-08-05T20:44:10.827910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-05T20:44:10.890407Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.890407Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:22dce474069a62f9d8b29827d33decb6422926bb3eed9aba74a69c330e4a9ded","observation_id":"fb06e333-9da3-4435-ba91-0b2c8208054e","resolution":{"observed_at":"2026-08-05T20:44:10.890407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T20:44:10.965681Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.965681Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3b150d4257d0420c929aea2c0f9c60f787a2a88584e2212f6723fd946264fa92","observation_id":"0a9f6bb9-d2f5-455e-8ebc-1323b3f2d242","resolution":{"observed_at":"2026-08-05T20:44:10.965681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T20:44:11.031053Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.031053Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:44695d7bc94638b371cc704b55ccf119fa20f4fe758068208193793e95db9c5f","observation_id":"97a4601e-976b-4aee-a89a-3b446283c17c","resolution":{"observed_at":"2026-08-05T20:44:11.031053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T20:44:11.140230Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.140230Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:32b837c8c9181792f611b6bcc9b9e24a9d75ffd401dc2527ec36ef44e35b86e1","observation_id":"cc1c951d-86d4-43dc-88e6-8323404fe7e1","resolution":{"observed_at":"2026-08-05T20:44:11.140230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:11.209115Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.209115Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:fe236729aad6de608806ad0cd0145ba9420c667f2042f24a66e65b4147bafd6e","observation_id":"a9b7a0c5-af64-46f3-9b24-bc9e6904c3cb","resolution":{"observed_at":"2026-08-05T20:44:11.209115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T20:44:11.307662Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.307662Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:1200ba9e405158facac29015fcb29d6e4d6ae0ba8f185492167ef507f7d46f69","observation_id":"0413e382-52db-46f9-8719-9efc0395d285","resolution":{"observed_at":"2026-08-05T20:44:11.307662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:11.389528Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.389528Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:17149d0fbb76945aafa0005c9e88e0ceeecad06397f97f436fa51a8a49d1bd04","observation_id":"669b36a1-b70e-4040-8632-c5031034c7f0","resolution":{"observed_at":"2026-08-05T20:44:11.389528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T20:44:11.474169Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.474169Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:105dbfaeb2d4f636a6919262f1ebd94e73f83ae239f868a797758aea53654c54","observation_id":"a496aa47-6186-4223-bf92-5645788ca429","resolution":{"observed_at":"2026-08-05T20:44:11.474169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T20:44:11.546425Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.546425Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:24e27f2599d7e753c8b9ce22062c1285bf83735210b28b4192927338b21d924a","observation_id":"e08b543a-3a34-488d-a6e8-45e8dd3a0fbf","resolution":{"observed_at":"2026-08-05T20:44:11.546425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-05T20:44:11.606456Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.606456Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:bd20f577df7ee02bd7d4552c31c8382dd01fffffcf0fd829d45b9e98b9fb0d13","observation_id":"2495bef3-5bb7-47dd-8736-453fa1f105bd","resolution":{"observed_at":"2026-08-05T20:44:11.606456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T20:44:11.699910Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.699910Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:735f8f2379071e43b6d1b1d33fe4c532db3a6ff2b1323c991890658c52813b45","observation_id":"21cde564-0d55-4a8e-a3ae-3cdf3dcd7b23","resolution":{"observed_at":"2026-08-05T20:44:11.699910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:11.819994Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.819994Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2d1f26d75ef155811646bb7bec304a9107fa342cdd5a3074cd045ad242c55d46","observation_id":"46ce3066-ded4-48b6-a4fc-a590c1e153e8","resolution":{"observed_at":"2026-08-05T20:44:11.819994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-09T10:38:02.941912Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-05T20:44:11.883278Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.883278Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:52799631140383574c0f611cbe3f0938e1197afe0d27927d3896c49f7dd44d0d","observation_id":"013bb6d9-fef6-4856-a0fd-0524bf938b8f","resolution":{"observed_at":"2026-08-05T20:44:11.883278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:23.481318Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"b5556207-68a4-4a0a-b929-fc2702347686","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.977252Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f7fad6f280002ef7958b89a9f92564eb8112bf6846f48cad5da71c28b63dde2b","observation_id":"0c5d3d43-a58b-42ee-8789-60210e68f368","resolution":{"observed_at":"2026-08-05T20:44:23.523614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:12.088623Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.088623Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:ec602dfc0cbadbe66e3f1fb2da25cc668fcbb403ae30fa10b9a5b5aa18b0dc24","observation_id":"6f1fba65-6838-45c5-9b27-3fb226a9fba5","resolution":{"observed_at":"2026-08-05T20:44:12.088623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:23.278018Z","title":"Gemini 2.0 flash","venue":null,"work_id":"80504cd5-f8c0-4a6d-8a85-1c5e2019282b","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.163832Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0b7ecc17be9278a6b383af23c01f4ae7619a63af04dfe82928c279321a6f2463","observation_id":"c8cae32e-ceaa-4ea0-aeb3-6c90f0bf8e42","resolution":{"observed_at":"2026-08-05T20:44:23.361409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:44:12.258440Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.258440Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e600eede5a5c9ed311dd899fc46c0ba1b2c6628d72e2f6564795bfeb069d0b28","observation_id":"9254bbaa-5f05-4d51-bb8e-8dda23a2fa65","resolution":{"observed_at":"2026-08-05T20:44:12.258440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10529","last_updated":"2025-03-13T16:37:26Z","snapshot_observed_at":"2026-08-07T17:06:33.248223Z","submitted_at":"2025-03-13T16:37:26Z","title":"PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10529","snapshot_observed_at":"2026-08-05T20:44:12.369370Z","title":"Pisa: A self-augmented data engine and training strategy for 3d understanding with large models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.369370Z"},"links":{"cited_paper":"/paper/2503.10529","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:954d005e089ca6ab06597fc3f1cab78862d795506b194b0b254949d5dbd9a7b7","observation_id":"3cb084c7-d4b8-4bcc-b561-a4bbe46415cd","resolution":{"observed_at":"2026-08-05T20:44:12.369370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-05T20:44:12.432203Z","title":"Can we generate images with cot? let's verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.432203Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:234de3038956fdcb0d967a7f2bce699525880ddb4c7f633be0b1f0443ce26d57","observation_id":"1c41b22a-8423-4dd8-9ff9-b14b3a0b11d8","resolution":{"observed_at":"2026-08-05T20:44:12.432203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T20:44:12.504055Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.504055Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:92b54240452c4401db5f7b96362d2171d29b51854c0b952769fdbec4ef36a0c8","observation_id":"5ac129a1-469f-4d0e-8853-84325d4ba9fd","resolution":{"observed_at":"2026-08-05T20:44:12.504055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-05T20:44:12.564771Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.564771Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a8fd610c7f5ed005896de8917f970dec74a90c00b18dbb685b24c0b25b5bf07a","observation_id":"97dabc6a-db8a-40ef-beeb-1ff6075eb843","resolution":{"observed_at":"2026-08-05T20:44:12.564771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:22.941659Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"05006a0e-62ed-4680-adfe-fec0085da122","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.627331Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e03688dc5f6a17ebd322d7ef491dea0502ae69b124685ea42bf23cfad16123b5","observation_id":"7a515664-b7a0-4767-a102-1e81076cb6f6","resolution":{"observed_at":"2026-08-05T20:44:23.131160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T20:44:12.680706Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.680706Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:db5bb3890cc3d0ca26c62d35fa85e2371e457fcd874bb82f0bfc72aff736add5","observation_id":"536242bd-79f5-4edf-b5cc-89f572b67e5e","resolution":{"observed_at":"2026-08-05T20:44:12.680706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03653","last_updated":"2024-11-27T09:55:41Z","snapshot_observed_at":"2026-07-06T17:55:49.302964Z","submitted_at":"2024-04-04T17:59:46Z","title":"CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03653","snapshot_observed_at":"2026-08-05T20:44:12.755158Z","title":"Comat: Aligning text-to-image diffusion model with image-to-text concept matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.755158Z"},"links":{"cited_paper":"/paper/2404.03653","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d902f0e6a02f58b5facf4383fc16de15559fb0c1e42f04c115d5a94e9774edd5","observation_id":"c7d45430-4670-46bf-abdf-01758b3f0373","resolution":{"observed_at":"2026-08-05T20:44:12.755158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-08-10T08:10:46.203990Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-05T20:44:12.841584Z","title":"Mmsearch: Benchmarking the potential of large models as multi-modal search engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.841584Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:61525b982c6c5ccce7cfec8eaa4d8d6ddadf7178c25e8a9f4926ba6e2bded0f1","observation_id":"b065b8fc-0f30-42c5-adfa-00e05b1bc5f6","resolution":{"observed_at":"2026-08-05T20:44:12.841584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-05T20:44:12.948621Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.948621Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:ed8620c77d8d2fb95ae6093637b518d5882240da3ddf6edaecdf3d61b58e187f","observation_id":"ac2ac4a8-37f7-4a10-9308-141a84c5d824","resolution":{"observed_at":"2026-08-05T20:44:12.948621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-09T00:23:29.329507Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T20:44:13.035019Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.035019Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0fcb13ef5ef5a9614613daf0dcd1c0701d5f99cd3251ba432c2cd5a684c0f025","observation_id":"537b8e27-1d48-45fe-9349-229f5710d9d2","resolution":{"observed_at":"2026-08-05T20:44:13.035019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T20:44:13.131965Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.131965Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:719024311652797280d4bc862001e05d4cf7a1869a4c6ba15c019b204da58b07","observation_id":"eeee2d81-7577-4268-aec4-0d0e8cb0bc80","resolution":{"observed_at":"2026-08-05T20:44:13.131965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:13.239307Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.239307Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:774ac9a6bb3ad0061f0d3c7b726b523f60d65b09b7995d67ab8e9ea3ebad800b","observation_id":"9f0e7380-5565-4469-8545-0d46e55d4818","resolution":{"observed_at":"2026-08-05T20:44:13.239307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:13.299556Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.299556Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3b2a9606b9999b07886a09a57467b95d81e16c4b4922e3b2ed84391dc2b19a6e","observation_id":"d76b024a-e6ab-4322-a1b3-20081f7708fd","resolution":{"observed_at":"2026-08-05T20:44:13.299556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-05T20:44:13.367107Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.367107Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:9d43fac04c69e36c146d9ad79f90bf98bcd5b871463d8e05c1f9e2e5cd689011","observation_id":"d33fa69b-7a28-4909-9114-fbebdc2da3be","resolution":{"observed_at":"2026-08-05T20:44:13.367107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14765","last_updated":"2024-08-27T03:41:44Z","snapshot_observed_at":"2026-08-06T11:14:38.844865Z","submitted_at":"2024-08-27T03:41:44Z","title":"CrossViewDiff: A Cross-View Diffusion Model for Satellite-to-Street View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14765","snapshot_observed_at":"2026-08-05T20:44:13.455328Z","title":"Crossviewdiff: A cross-view diffusion model for satellite-to-street view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.455328Z"},"links":{"cited_paper":"/paper/2408.14765","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:fc4640d3f13b850740cb3a17545da5393611ca9e67c37510c648d0cec71c70c8","observation_id":"e8fecf9f-ad82-47a4-839e-4c0e0c6197b2","resolution":{"observed_at":"2026-08-05T20:44:13.455328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T20:44:13.554546Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.554546Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c3c74711543173643aa3221b8aeae5047a911c664c8d31db7cbec49a5d741077","observation_id":"e7854012-5878-4145-a2f3-f0b127f40fdd","resolution":{"observed_at":"2026-08-05T20:44:13.554546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-05T20:44:13.670112Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.670112Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:24000d894a2be030501c5f2f69bf70c7cbd9aff336e73c9e48388b1862e8f0a0","observation_id":"1edcc029-c7a2-4424-9eaa-778cfe197606","resolution":{"observed_at":"2026-08-05T20:44:13.670112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:13.852362Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.852362Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d011bb2a3feacf7e4bbf60d5dd6bfa849b65430a88d5f9e9a945826153daf9ee","observation_id":"96bb787e-a117-4b9c-b4d2-0490c681795f","resolution":{"observed_at":"2026-08-05T20:44:13.852362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-05T20:44:13.931759Z","title":"Evaluating text-to-visual generation with image-to-text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.931759Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:82e36683d5e9724163ef912d30032f1413aba628df045f576ff19fdf42aa7791","observation_id":"15f05b24-c517-4cf2-a712-3970452c8e49","resolution":{"observed_at":"2026-08-05T20:44:13.931759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:22.625776Z","title":"Visual instruction tuning","venue":null,"work_id":"2f398aaf-f117-4a08-961b-584a034b70a7","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.038559Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7b81c86cab4831224c677ff1423dd6525bf7811e64b0f2c508282ab625a48422","observation_id":"ef264d48-ff5c-4941-9c5c-0fde57f60077","resolution":{"observed_at":"2026-08-05T20:44:22.745660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:14.104263Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.104263Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4fc0f74b6a2f1063e8517a5656d0ab3cfbd36ccbdc216e3c2d951ac35f5469f5","observation_id":"b3b2deda-1d67-44f3-ae94-ec315b1903d6","resolution":{"observed_at":"2026-08-05T20:44:14.104263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T20:44:14.255400Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.255400Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:1268239a1de2a04fa0cdbd427540b6fc613044fa556fc28203e865b5bc4e3d0d","observation_id":"29b277f6-3478-4afb-b12d-ca87597a64cc","resolution":{"observed_at":"2026-08-05T20:44:14.255400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:44:14.390201Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.390201Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:bba8b0aef89e60e8c9f2b26c38528508c3c623c386b260c7cde18a1fa8a40608","observation_id":"b74d1110-41e6-40c1-9fd0-3fde59ad31c3","resolution":{"observed_at":"2026-08-05T20:44:14.390201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:14.465050Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.465050Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:bea5501c591bf81f54269bcc0777519f64c5ec5646a5459a684186086cdb43c1","observation_id":"e491591a-c5fb-4ea4-9fb1-c8ef4e85a808","resolution":{"observed_at":"2026-08-05T20:44:14.465050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T20:44:14.544936Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.544936Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:8dbc554fe887075967ecedc1fcea3985909ba925494419ef2291b03b40dcfeb6","observation_id":"8b0ca092-b47e-4b6a-b559-4a2cc6f71a60","resolution":{"observed_at":"2026-08-05T20:44:14.544936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:22.280795Z","title":"GPT-4V(ision) system card, 2023 c","venue":null,"work_id":"e620aa92-a5fd-4e57-90f0-edc1a3e4d931","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.654402Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f9a9d50186ad085bb10e2531a3aa364e6a59838c16886c6f55e3ace55a1e4042","observation_id":"6b7be0b3-184d-4b69-8eb5-b3ca8f3a3970","resolution":{"observed_at":"2026-08-05T20:44:22.415811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:14.813143Z","title":"Dall·e 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.813143Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:03bab37b321c12ec8c8bee3206dc734a9579d8c656bfa55aa3d4aa2d375ef397","observation_id":"700e44bb-11b0-4977-9a4b-b32311c363a4","resolution":{"observed_at":"2026-08-05T20:44:14.813143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.819827Z","title":null,"venue":null,"work_id":"82b0e0b8-5050-4360-8da5-0649c2a8123e","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.924248Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a5525f1b9f67f036997c07ef686d3c30074b09448c661371b0449b90e2e0de78","observation_id":"786b6bb7-1fe6-4836-9248-a1b61e0b8f3a","resolution":{"observed_at":"2026-08-05T20:44:22.066520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.512124Z","title":null,"venue":null,"work_id":"69aa880d-f23b-411d-a1cb-710843acf51d","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.018814Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:152d42295d1aaf8738d6d9322aa688fd820099b17d5b40802de0d509714af947","observation_id":"ce6d28a4-dd5a-4a0d-b3b8-3b3878bf56ec","resolution":{"observed_at":"2026-08-05T20:44:21.653553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-05T20:44:15.111083Z","title":"Transfer between modalities with metaqueries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.111083Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4b65b741601b054fbe0762e3da2bd824bbb472c2956d51aa9ed9de6d0b3e3d64","observation_id":"bc58b3d3-28a5-44a2-9759-bd83c6352742","resolution":{"observed_at":"2026-08-05T20:44:15.111083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T20:44:15.208196Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.208196Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b2a7df2ce9d536a191d1bb1deae0dd96fcbe9b099a7aba707e2c5d1cf4c3f46d","observation_id":"1268b0aa-837c-497b-9fbd-7c962c5667d5","resolution":{"observed_at":"2026-08-05T20:44:15.208196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.240970Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":"e0642074-3059-429d-a129-f1f7d6c0843b","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.342084Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:589527afeea30a880d63f433e2721cb3d828fab629affa7f003b91cea8e965d0","observation_id":"d626d2a7-e5f8-4924-b316-49e5c9a29f2b","resolution":{"observed_at":"2026-08-05T20:44:21.328873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T20:44:15.466929Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.466929Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3dc287299821d8276fa39e59a2ac6e8a121759faf6d2285c5ba3776c2f797ece","observation_id":"d4ce61b1-0977-44b7-943a-a93b7694132a","resolution":{"observed_at":"2026-08-05T20:44:15.466929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:15.560365Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.560365Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:ed8af1a1cb84a67a76ee5c40df8f7a2c7b994a02a87a42793592c66bebdc0e34","observation_id":"1565b050-13d7-44d7-89b9-1d9e7d97a88b","resolution":{"observed_at":"2026-08-05T20:44:15.560365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.031699Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2bcc7b08-ccdc-42d1-912a-4e79c743db95","year":2022},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.634551Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:825745e34e15fa0e41628a3a77bb37d1d0c72ddd9882716466a3cfcdd9111951","observation_id":"e043e2f4-65c6-4329-a8f4-45e308aabdc9","resolution":{"observed_at":"2026-08-05T20:44:21.096417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.852776Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"31434a76-1dcf-4318-be05-47401a385e06","year":2022},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.688147Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:ffb73c4dcfd2db8db207e5ca0078696060b74a01cf846d82c16d4834ceaba3a8","observation_id":"7e1b5794-57e4-43d6-ae34-5f736ffe59bc","resolution":{"observed_at":"2026-08-05T20:44:20.943984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:15.762368Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.762368Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:9511f2e3ddb9a295c2e27bd172dd279dde8137a6d099f632119d148318c1261f","observation_id":"86ca084c-fab6-4139-a63d-6d3ac42082a7","resolution":{"observed_at":"2026-08-05T20:44:15.762368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-05T20:44:15.870519Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.870519Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4fed4ba857d26483761c4c4f594d8e588846157c063abe4fcd38c73829411d79","observation_id":"0751e862-9eb7-42f8-90f8-edd4ff0e57a6","resolution":{"observed_at":"2026-08-05T20:44:15.870519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:44:16.057133Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.057133Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7aa7721575a297d27b456d4cfa2804938b032f45ba5ba4419b197ff7493844af","observation_id":"eec3108d-0d5d-42b9-8fe0-56002d0fe716","resolution":{"observed_at":"2026-08-05T20:44:16.057133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T20:44:16.154776Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.154776Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:204234ea9caba4d41958de72625724ed497e40d9888e1b6e2d3a7d56bdf39ad7","observation_id":"2adcf704-cc20-496a-9476-b17d332f7b92","resolution":{"observed_at":"2026-08-05T20:44:16.154776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-09T20:03:22.865577Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-05T20:44:16.254186Z","title":"Gpt-image-edit-1.5 m: A million-scale, gpt-generated image dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.254186Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c4cbc377b6b64352b3dbe57c3b72bf706b0f7d171fc9ce8459529548c64dec5f","observation_id":"ccef5db5-15eb-4134-9cfd-857a8cfa91a8","resolution":{"observed_at":"2026-08-05T20:44:16.254186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02161","last_updated":"2026-07-12T08:53:18Z","snapshot_observed_at":"2026-08-07T11:27:10.636069Z","submitted_at":"2025-06-02T18:44:07Z","title":"TIIF-Bench: How Does Your T2I Model Follow Your Instructions?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02161","snapshot_observed_at":"2026-08-05T20:44:16.332457Z","title":"Tiif-bench: How does your t2i model follow your instructions? arXiv preprint arXiv:2506.02161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.332457Z"},"links":{"cited_paper":"/paper/2506.02161","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3bc404fbe3a8a6064bd0862dd21940ea9c1fdf0d001f9fa52f6cbf2983f2b13e","observation_id":"31c843ec-e643-4c38-9c8d-3749a0c7960a","resolution":{"observed_at":"2026-08-05T20:44:16.332457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:16.378281Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.378281Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:88c213afef37093384f3fbc9e8bb88faa0481591e32cbbcaae1b9a1085d28d07","observation_id":"b202c619-3cc5-410c-a751-e1392b7e1a01","resolution":{"observed_at":"2026-08-05T20:44:16.378281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-05T20:44:16.475472Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.475472Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0780b89d7611f6ea5042f7094e99860c8c55748064a6506e4cfb616cba4b31a8","observation_id":"276f6e35-9182-4dfc-a0df-9f322ea10bf2","resolution":{"observed_at":"2026-08-05T20:44:16.475472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02160","last_updated":"2025-04-02T22:20:21Z","snapshot_observed_at":"2026-08-07T16:13:24.968703Z","submitted_at":"2025-04-02T22:20:21Z","title":"Less-to-More Generalization: Unlocking More Controllability by In-Context Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02160","snapshot_observed_at":"2026-08-05T20:44:16.671224Z","title":"Less-to-more generalization: Unlocking more controllability by in-context generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.671224Z"},"links":{"cited_paper":"/paper/2504.02160","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4133119d75d24be82c04a30d0a3971a62338987c7a5d4c837ba981cd57f7851a","observation_id":"6770393b-c88b-4663-8b23-dc95edadc091","resolution":{"observed_at":"2026-08-05T20:44:16.671224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T20:44:16.792997Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.792997Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:26df93f9883178642797792565148b2b9cfb5b7296711b3977361c1c94a6bc7e","observation_id":"eeea55b8-05d8-4c65-b7ac-5545717ab100","resolution":{"observed_at":"2026-08-05T20:44:16.792997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.640103Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"ebe49004-5ec0-4816-9f20-628a30914824","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.871964Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:00671c81feea5f6510c5e738d388060a2bd54b582dcce1585e51a34a08899178","observation_id":"22868f17-5beb-4301-b17d-3d16e94d28f9","resolution":{"observed_at":"2026-08-05T20:44:20.728214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T20:44:16.966007Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.966007Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7d50edaa993b659256813c832d2398f4b54e06c5c337b7662e5fe54bc2c04f32","observation_id":"d3fbf88e-5d6a-48df-a184-85ccf5454910","resolution":{"observed_at":"2026-08-05T20:44:16.966007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-05T20:44:17.042652Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.042652Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:48908d63292d2230d989b8242719e27dda600c88171db10d6279e004bcd0cda6","observation_id":"33200aa2-a6a0-47a6-a36b-2cecc935da35","resolution":{"observed_at":"2026-08-05T20:44:17.042652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-05T20:44:17.158713Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.158713Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b2d2a182bcd6310bb62adeeedac4086a266f7e7bf0320d61624c10278146b820","observation_id":"6a496748-550e-4b94-9a5a-8e115ba8c9a7","resolution":{"observed_at":"2026-08-05T20:44:17.158713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02782","last_updated":"2025-05-02T04:42:06Z","snapshot_observed_at":"2026-08-07T16:10:49.986016Z","submitted_at":"2025-04-03T17:23:16Z","title":"GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02782","snapshot_observed_at":"2026-08-05T20:44:17.270406Z","title":"Gpt-imgeval: A comprehensive benchmark for diagnosing gpt4o in image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.270406Z"},"links":{"cited_paper":"/paper/2504.02782","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:91cb171f38f718509a6328034219ed444ce3991a91386ad72ffac14a748f8251","observation_id":"c0c1295e-055b-4fd9-a112-8a432002e628","resolution":{"observed_at":"2026-08-05T20:44:17.270406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.436813Z","title":"The fabrication of reality and fantasy: Scene generation with llm-assisted prompt interpretation","venue":null,"work_id":"7c264ecb-26e8-48b8-ad89-8215f9bcc53f","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.333380Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2176646b3774a866695e24da009314b4385cb1a041a3faaa89ec8fa5c101a456","observation_id":"8ab861fb-602b-4843-91ac-80f88e1e7445","resolution":{"observed_at":"2026-08-05T20:44:20.513604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.249150Z","title":"Skydiffusion: Street-to-satellite image synthesis with diffusion models and bev paradigm","venue":null,"work_id":"ba57911b-077d-4772-bfec-01ef37acfb0e","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.442397Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:ac3f7c5ed5ae31547d7134fbd2f3898454663c19171158e5f3952d29b9d56ebe","observation_id":"152a51c7-8452-4b4f-a891-a2d42955a03b","resolution":{"observed_at":"2026-08-05T20:44:20.319888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09732","last_updated":"2025-04-21T02:36:09Z","snapshot_observed_at":"2026-08-09T09:24:59.615897Z","submitted_at":"2024-10-13T05:26:36Z","title":"LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09732","snapshot_observed_at":"2026-08-05T20:44:17.585671Z","title":"Loki: A comprehensive synthetic data detection benchmark using large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.585671Z"},"links":{"cited_paper":"/paper/2410.09732","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:03021e2e4c7e18b5f6d0919a6ccf1098cbb92f8613930680f1e9f011dd4d4c8f","observation_id":"48755bd2-c57a-48c5-aec5-8dd61a2ccc70","resolution":{"observed_at":"2026-08-05T20:44:17.585671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.037453Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"e98efb42-2861-4f50-a112-c4296add11ac","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.696061Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:fe486de26e915fb8a39dfdba1eda69733b20e3359386048a15959b19fa37e82e","observation_id":"8b0dddf8-44ef-465b-a070-e08ecac09a8b","resolution":{"observed_at":"2026-08-05T20:44:20.123840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-05T20:44:17.843196Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.843196Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:805d5e8f64a7f7709aa1f337549bc558604a1b19427f2626c685aeef9e0670a5","observation_id":"71c09a01-7924-40c1-98d8-da3eda218ec8","resolution":{"observed_at":"2026-08-05T20:44:17.843196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:19.786690Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"09cf9ddf-ecf9-4018-8a7b-9de61e5401dd","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.937041Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:db407d6c84905c251d0f668ab6f757c37fc7fafdc739df04bf4ec5da0c316244","observation_id":"368ac5c2-1d7a-43de-aef5-1e26b2a2556e","resolution":{"observed_at":"2026-08-05T20:44:19.903316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:19.634755Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169--186","venue":null,"work_id":"1886b87c-cbc0-427c-afe8-67ffaa2081fe","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.003309Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d87ccd0f1c3aea19fa87e5a31d205bd9c121be682f7b321dea7cd2f65f845d79","observation_id":"1fbe3f38-a77e-41fb-a23d-3a9c4e3cf118","resolution":{"observed_at":"2026-08-05T20:44:19.701308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-05T20:44:18.084915Z","title":"Mavis: Mathematical visual instruction tuning with an automatic data engine, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.084915Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6238cb57ee662ceca842a592dda534fcccc30597bd526326c8ada0bbc646536a","observation_id":"1c842d2f-a386-4325-bfd3-8d7b4aa80f9d","resolution":{"observed_at":"2026-08-05T20:44:18.084915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T20:44:18.171068Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.171068Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2b694b3591091a1a501af79b297ee9b265e0b1d83e1723783771c6e1906f10c2","observation_id":"57992e02-9dd8-4f1c-b753-d67c0251ccf2","resolution":{"observed_at":"2026-08-05T20:44:18.171068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T20:44:18.224864Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.224864Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:bf07596f12681b9a2226a0724ec002f93ad9d7f4f6767b5fd82579d151389b9d","observation_id":"5fe73f18-f381-49f7-b573-9eb9369a696d","resolution":{"observed_at":"2026-08-05T20:44:18.224864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:19.474168Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":null,"work_id":"e10272ca-9b9b-4826-9e35-4be296f31242","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.313183Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2d29f7a3044ba4dc63c739989840ce600905a221be87806719e8bb7da8d63d6e","observation_id":"6210cb88-0136-4d27-ac1b-3b0f2b9bb64d","resolution":{"observed_at":"2026-08-05T20:44:19.536676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09618","last_updated":"2024-12-12T18:59:48Z","snapshot_observed_at":"2026-08-05T06:04:07.740731Z","submitted_at":"2024-12-12T18:59:48Z","title":"EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09618","snapshot_observed_at":"2026-08-05T20:44:18.395972Z","title":"Easyref: Omni-generalized group image reference for diffusion models via multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.395972Z"},"links":{"cited_paper":"/paper/2412.09618","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d8d69eebd7b19b87e868173077e6f72f0911eade7a9dcffe8ddbe98cc4488c8e","observation_id":"598ab3a7-4c0c-4cc4-a8a6-16ea8eceeea2","resolution":{"observed_at":"2026-08-05T20:44:18.395972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13046","last_updated":"2024-10-31T17:39:34Z","snapshot_observed_at":"2026-08-05T02:05:40.291312Z","submitted_at":"2024-04-19T17:59:48Z","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13046","snapshot_observed_at":"2026-08-05T20:44:18.490290Z","title":"Mova: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.490290Z"},"links":{"cited_paper":"/paper/2404.13046","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:239e4bc4aa8a212f25569c8c79ad6f5a72e0087a2eb33ae0511cd23c18d6331b","observation_id":"0ff93221-48a4-4c12-9888-aff39271040f","resolution":{"observed_at":"2026-08-05T20:44:18.490290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 34 inbound Pith citation observations for arXiv:2508.09987."}