{"as_of":"2026-08-11T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a9d2cba1286ebd730628326dfc7238a107ef926e339f3c03bc6b175c2051426","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:53:27.913006Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07086/citation-record","integrity":"/paper/2501.07086/integrity","json":"/paper/2501.07086/citation-record.json","paper":"/paper/2501.07086"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.556617Z","title":"GLIDE: towards photorealistic image generation and editing with text-guided diffusion models,","venue":null,"work_id":"1ce62a14-2cbd-406e-b8e8-16b35c14ea7f","year":2022},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.669201Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:8b90d4f89b0fed719a9d813d05d67443ca296ad25f694470b4f4ecd5c36e8858","observation_id":"5c09b0f4-655d-4712-b47e-ace5d8872c24","resolution":{"observed_at":"2026-08-10T20:53:28.561574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.541403Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":"4d6486d8-0fbb-4c78-90e9-94ad9b0488e9","year":2021},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.676905Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:33fafd2870512cd9b6c7be9737678c434f67ada784feffd2be21b1d2f6f61720","observation_id":"bc7188f2-a1ad-4184-9c6b-93f933c60f96","resolution":{"observed_at":"2026-08-10T20:53:28.546171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.522469Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"9db29a38-50c4-4c4d-beaf-cc1124763e77","year":2022},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.706976Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:81806a433d9839f03c3a65cdaed39327004ddfeee980e7c26a0a05c532850aec","observation_id":"ff87c1b7-825f-46b8-9328-962e2d6ade18","resolution":{"observed_at":"2026-08-10T20:53:28.528242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.507549Z","title":"The revolution of multimodal large language models: A survey,","venue":null,"work_id":"64de125e-70e2-4341-883c-0c1fac70b67a","year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.757052Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:1052723b6386058669d6e5e819c6e5b2741a347d04b9fa2a6926f977b9e2bf3c","observation_id":"e843a7ca-0d43-46e0-83f7-cdae742cdf4c","resolution":{"observed_at":"2026-08-10T20:53:28.512292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.491349Z","title":"Design guidelines for prompt engineering text- to-image generative models,","venue":null,"work_id":"dccfe821-376f-4bf7-a8a9-575cc1b5d80c","year":2022},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.789964Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:cb8e89143b56fe39b4b852aaca39616dea3b325333c108a13469065d92399c1c","observation_id":"3b34aee4-f94c-43ab-aeb4-6d37ff67b7a5","resolution":{"observed_at":"2026-08-10T20:53:28.496749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-10T12:19:42.891683Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-10T20:53:27.795138Z","title":"Generative multimodal models are in-context learners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.795138Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:e023b0c7f938976db8eb07672aa7cf424e19d522c7a398ee79b5005d870e4301","observation_id":"64dee35c-00a8-4223-9320-0abecbadc0b8","resolution":{"observed_at":"2026-08-10T20:53:27.795138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.474900Z","title":"Promptcot: Align prompt distribution via adapted chain- of-thought,","venue":null,"work_id":"ab1be271-b437-4abc-b5a4-9c3b4a1f2a2d","year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.804754Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:44977b7f9e344053d4cb72439f3f7a83367b859c0591588d1ceb01096b64a578","observation_id":"6c2327d7-e453-4c93-b25e-6cd6ba745609","resolution":{"observed_at":"2026-08-10T20:53:28.480015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.459411Z","title":"Not all languages are created equal in llms: Improving multilingual capability by cross-lingual-thought prompting,","venue":null,"work_id":"62ae0ffb-b6e9-4cdb-9254-8f1470845a69","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.816471Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:c801310108bff6f67a62418d82a22cfb17a25f29acd5bb0714cc66e26bcb1d45","observation_id":"d45e8b67-f011-4d74-b167-4f73e178c5f5","resolution":{"observed_at":"2026-08-10T20:53:28.464282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.425946Z","title":"Cross-lingual prompt- ing: Improving zero-shot chain-of-thought reasoning across languages,","venue":null,"work_id":"808ff289-a70f-4a85-93c8-0580cfcd711d","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.825982Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:1b8af48824247fc41ecf498ea3366dad755f814eebac7cae2917b35cef0146d1","observation_id":"5d79981d-5e90-4e23-8910-71bee16d0996","resolution":{"observed_at":"2026-08-10T20:53:28.432734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.408436Z","title":"PLUG: leveraging pivot language in cross-lingual instruction tuning,","venue":null,"work_id":"3737935b-1641-476f-9849-8aa829f25eeb","year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.830870Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:0931790ca4ff8e607e7a64aa8e56e2fa3bb0989bb4e63df767408992cfdc5a3a","observation_id":"da7a3b5b-2483-43b3-a1c7-525a0fb0cc1a","resolution":{"observed_at":"2026-08-10T20:53:28.413772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09073","last_updated":"2025-06-03T03:12:09Z","snapshot_observed_at":"2026-08-07T22:13:33.576863Z","submitted_at":"2024-03-14T03:33:46Z","title":"Revealing the Parallel Multilingual Learning within Large Language Models","version":3},"cited_work":{"arxiv_id":"2403.09073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09073","snapshot_observed_at":"2026-08-10T20:53:28.047636Z","title":"Revealing the Parallel Multilingual Learning within Large Language Models","venue":"cs.CL","work_id":"6b128d2e-d246-4875-8d35-cd3be5bc0ecf","year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.835654Z"},"links":{"cited_paper":"/paper/2403.09073","citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:99875576eec9add5b3645e28840d15faf16b758d21cccbeaf50d1af8fcfbca74","observation_id":"cf8ad285-c9ec-4bbf-b056-67851978658c","resolution":{"observed_at":"2026-08-10T20:53:28.055231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.391123Z","title":"LAION-5B: an open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"6823526d-47b8-4e6c-8e8d-fea0e110dbf2","year":2022},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.840560Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:c93536b74c2ac17e5ebe0d18babacf1a754ad84014ab3ba5b8e51422ee9825c3","observation_id":"ae032c7f-a368-466f-bcff-c2fdbf153b55","resolution":{"observed_at":"2026-08-10T20:53:28.397020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.373144Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"5c762e4e-e6e2-4927-a026-a68a8b71d4f2","year":2020},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.845353Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:63f9b0cb132db8137d3a7e93437e3e985b2afdc7341555de7a74c57bb4c6b414","observation_id":"d6bf1b94-9ff5-47d2-805e-a1f6d0ee3f85","resolution":{"observed_at":"2026-08-10T20:53:28.378402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.356575Z","title":"Taming transformers for high- resolution image synthesis,","venue":null,"work_id":"2aabc6b3-a525-414c-a5e2-d0535985d4de","year":2021},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.850132Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:52cb954ecdacdccaaa8497a11377af4fee5fc80b8e67a4320d70af56fe9f7350","observation_id":"245c3e8f-6ab6-461c-88c1-83c2602f244a","resolution":{"observed_at":"2026-08-10T20:53:28.362226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.338733Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":"069526b0-81d4-4df9-a1c0-8a69b8c1e2ee","year":2021},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.855077Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:ae11bb1f973c65fecad7f4ee57f720fe540708f2fb248c0c5a4478bc0ec20ef3","observation_id":"b85d43a4-c851-4411-bc88-d6b2da11086b","resolution":{"observed_at":"2026-08-10T20:53:28.344341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:27.859826Z","title":"Microsoft COCO: common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.859826Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:cbaab36592d846e3bab8e5593ffda5bc24c056367fa16b04f350724b5c0d85da","observation_id":"eeed5c60-77dd-40a2-ac61-3415df90a96f","resolution":{"observed_at":"2026-08-10T20:53:27.859826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:27.864672Z","title":"Improving image generation with better captions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.864672Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:e985f082b875589c115e11f1fc80450d7be4e25612da81b641b226754f398219","observation_id":"8e30d65f-3b00-49c4-bca0-7f73ba2739b0","resolution":{"observed_at":"2026-08-10T20:53:27.864672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.295758Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation,","venue":null,"work_id":"8053cb7d-f94d-423f-a102-7f718d9bc85d","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.874475Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:039353ffe1dcc5de9d73ad2161a5b74e3846d9fbc52759853f57d3587b192680","observation_id":"2cc3403d-8551-4c7a-b4ff-b67900ccc57b","resolution":{"observed_at":"2026-08-10T20:53:28.302428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.275588Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing,","venue":null,"work_id":"076dcc03-3e9e-43b4-ae3b-67b871e5fff6","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.879790Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:df87ab747715d5ce9a992dfd4482eb87a1e0fc7ae72629dd197dd8fa372f8654","observation_id":"aeb945c6-ee58-432a-b11f-023d886ea8e1","resolution":{"observed_at":"2026-08-10T20:53:28.281489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.256458Z","title":"BLIP: bootstrapping language- image pre-training for unified vision-language understanding and genera- tion,","venue":null,"work_id":"4491b013-5ce4-4b8f-865a-2b856fcceb1a","year":2022},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.884483Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:b2459aabc6621d0964c942d88eed50a131bd94787fc0d04b01a07338c7509045","observation_id":"76e9cbcf-bcb4-4703-b250-ecfdefdfaa1c","resolution":{"observed_at":"2026-08-10T20:53:28.262795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.220263Z","title":"Imagereward: Learning and evaluating human preferences for text- to-image generation,","venue":null,"work_id":"c3057736-3a9a-46a8-93be-039196b2a496","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.889016Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:fb0584fc4209a8096b013ff88488bdc4dcff038ed77e41cdafbf251fe8c737d0","observation_id":"49515561-7c1d-4a3c-9bde-93083d2c8c80","resolution":{"observed_at":"2026-08-10T20:53:28.235684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-10T20:53:27.893502Z","title":"Lumina- next: Making lumina-t2x stronger and faster with next-dit,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.893502Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:b58054db22be0e954de53726dbcb88fcde5a7108bf44e1c7f779764c8fd61395","observation_id":"d4fd8d51-e318-42f3-adb0-a86d990013b0","resolution":{"observed_at":"2026-08-10T20:53:27.893502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T20:53:27.898679Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.898679Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:9ea8f765225c87b8f8cc2d15d16db31769c86487097994d340beb7605c2556fc","observation_id":"d40e715a-7169-44ab-b756-e860f0a55c8e","resolution":{"observed_at":"2026-08-10T20:53:27.898679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.155718Z","title":"Optimizing prompts for text- to-image generation,","venue":null,"work_id":"f99c80dc-b486-4ffb-95ed-418439000c5c","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.903719Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:323907d6e7a73406e6cb7c417897bdf8a65101ebcd686cb7747a804d5452657b","observation_id":"aa3b67f8-2e80-4e97-ac35-e0e4c0e4dc06","resolution":{"observed_at":"2026-08-10T20:53:28.183564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02416","last_updated":"2024-11-02T10:01:38Z","snapshot_observed_at":"2026-08-09T15:01:00.846487Z","submitted_at":"2024-02-04T09:24:51Z","title":"Aligner: Efficient Alignment by Learning to Correct","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02416","snapshot_observed_at":"2026-08-10T20:53:27.908141Z","title":"Aligner: Achieving efficient alignment through weak-to-strong correction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.908141Z"},"links":{"cited_paper":"/paper/2402.02416","citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:7bde6a4d5bf1ea1c681ec500a7a55e53307afca229a987c34fb802b6076b0215","observation_id":"f22d0cdc-9799-45d9-af56-b3e61064f226","resolution":{"observed_at":"2026-08-10T20:53:27.908141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.101086Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision,","venue":null,"work_id":"7338b38e-2ba4-430c-bc9f-72b06aee38ed","year":2024},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.913006Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:92e82c0debb8f0801865e7e0e1da21574c6ef2ab3bd4dba304741ca0500f8bd6","observation_id":"17196ef3-5d1f-4214-b4b3-cdf3c1cb54e7","resolution":{"observed_at":"2026-08-10T20:53:28.114770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:28.444232Z","title":"12 365– 12 394","venue":null,"work_id":"ef10ac3a-3304-4d25-8623-f49ac138b3ca","year":2023},"citing_paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:27.821191Z"},"links":{"citing_paper":"/paper/2501.07086"},"observation_digest":"sha256:9f6170620bde3f1dc3f02e2bd788ce47264097322e5dfb7af6ab1c9abf67c769","observation_id":"1a4156a8-c63e-4c90-ba54-adc4cab0af09","resolution":{"observed_at":"2026-08-10T20:53:28.449198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07086","last_updated":"2025-01-13T06:41:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T20:47:11.699808Z","submitted_at":"2025-01-13T06:41:23Z","title":"Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2501.07086."}