{"as_of":"2026-08-10T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85b2a9e50412bfaeabc7242390b6ec5ca69384753c19bdd54746edde35748b33","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:54:38.274595Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21391/citation-record","integrity":"/paper/2507.21391/integrity","json":"/paper/2507.21391/citation-record.json","paper":"/paper/2507.21391"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T12:54:32.526329Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.526329Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:8c5018bfe803cbe103613cf0a8034c44509ea68ee9fd7e74e94a113b7605cc6f","observation_id":"056a1e6a-beb3-4817-b201-201c4fffe76b","resolution":{"observed_at":"2026-08-06T12:54:32.526329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:54:32.634149Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.634149Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:2e016fc1cbff623615c64957ff896e8057bbcc2550e2bce3057099cb9d1eb53a","observation_id":"0eb2ab8a-9a25-4c24-aadd-539f4e16e3a0","resolution":{"observed_at":"2026-08-06T12:54:32.634149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T12:54:32.751253Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.751253Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ee5f22dd421d2bd7812172818ce7fa40c3c2aed90e4acf5d692034adc544d1cf","observation_id":"1414ac53-eb29-4751-a06b-8f3f69844a80","resolution":{"observed_at":"2026-08-06T12:54:32.751253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01973","last_updated":"2018-06-21T14:54:33Z","snapshot_observed_at":"2026-08-07T19:33:19.839652Z","submitted_at":"2018-01-06T05:44:29Z","title":"A Note on the Inception Score","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01973","snapshot_observed_at":"2026-08-06T12:54:32.829262Z","title":"A note on the inception score","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.829262Z"},"links":{"cited_paper":"/paper/1801.01973","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:78df2a1db438329471588e610c3f89d9827659af496daba9e98b6ea7f1757cd0","observation_id":"b0e9eb8b-c2f4-4e4f-9905-3f8dce5d3266","resolution":{"observed_at":"2026-08-06T12:54:32.829262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03621","last_updated":"2024-10-31T09:11:03Z","snapshot_observed_at":"2026-07-06T19:11:05.273789Z","submitted_at":"2024-09-05T15:33:24Z","title":"Attend First, Consolidate Later: On the Importance of Attention in Different LLM Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03621","snapshot_observed_at":"2026-08-06T12:54:32.897882Z","title":"Attend first, consolidate later: On the importance of attention in different llm layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.897882Z"},"links":{"cited_paper":"/paper/2409.03621","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1f197476df75c6ab83138dd21de4da0631d4fd0c8ec09ac542a555b4663af086","observation_id":"b4616089-20a5-497c-8a4a-67aef162a28a","resolution":{"observed_at":"2026-08-06T12:54:32.897882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T12:54:32.955610Z","title":"Training diffusion models with reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.955610Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:9f3879dd51eac85778bc5280ede058959977d44a8e52fe936867d911d8a2541a","observation_id":"01a57abf-d454-4edd-97d9-20a2f7402118","resolution":{"observed_at":"2026-08-06T12:54:32.955610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:44.603911Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"db45a092-c04b-42c6-af14-6e43f3b96456","year":1952},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.077318Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:acd40aee3c7d2b2a43aa1b1d8b9177acf29ee67886ab28477bd11fd19d7adb6c","observation_id":"2c9bb625-c517-49c5-a40f-a8c3e4d0db53","resolution":{"observed_at":"2026-08-06T12:54:44.693809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T12:54:33.162969Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.162969Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:5fe4e89793c8566be4a3f7f3471808c7b411e76f7c3da6eff9989627ccd74bde","observation_id":"bb5a2d9f-8017-4cdd-8ae8-61688734c0a3","resolution":{"observed_at":"2026-08-06T12:54:33.162969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01106","last_updated":"2025-03-02T22:41:37Z","snapshot_observed_at":"2026-08-09T11:12:35.835685Z","submitted_at":"2024-11-02T02:09:01Z","title":"SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01106","snapshot_observed_at":"2026-08-06T12:54:33.250868Z","title":"Lora-contextualizing adaptation of large mul- timodal models for long document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.250868Z"},"links":{"cited_paper":"/paper/2411.01106","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:89765e05d932ebcac2bd372883e7b0b94f2832f91c1626d59082ff31a09d244a","observation_id":"bed65cea-25c8-4a87-a108-28b39587f9d8","resolution":{"observed_at":"2026-08-06T12:54:33.250868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04842","last_updated":"2024-07-05T20:03:16Z","snapshot_observed_at":"2026-08-05T13:28:06.601120Z","submitted_at":"2024-07-05T20:03:16Z","title":"MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04842","snapshot_observed_at":"2026-08-06T12:54:33.346700Z","title":"Mj-bench: Is your multimodal reward model really a good judge for text-to- image generation? arXiv preprint arXiv:2407.04842, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.346700Z"},"links":{"cited_paper":"/paper/2407.04842","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:3de8937d4426636fc1105fd69f8cbab9050e08c6900419e7c3b1595ec15297ba","observation_id":"02c55c24-4378-4579-8a74-f34efdfec3c2","resolution":{"observed_at":"2026-08-06T12:54:33.346700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:33.452384Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.452384Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:357a4a34f04baeb7b324a20263b8fb07c2857fa18ce95c24a7c852bf0b3f75da","observation_id":"8f92e954-ec8f-447b-a014-6cb2464831dd","resolution":{"observed_at":"2026-08-06T12:54:33.452384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:44.314892Z","title":"The socio-moral image database (smid),","venue":null,"work_id":"5c39e963-ec79-4f04-940b-7f09e0569f3f","year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.551927Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:23ae69dd7cccb3fa5620e979be47dc34d98796324e941f986044922e286a3c3b","observation_id":"fe32db23-e6ac-4c04-a95c-a2c6e99d02ca","resolution":{"observed_at":"2026-08-06T12:54:44.450201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T12:54:33.643754Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.643754Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:2659905dd3e89547fed5219f14ab8b6729ba68e70c8b831c968a54eb8af56eda","observation_id":"62b1b304-f88a-48e3-a114-a693b7d5c173","resolution":{"observed_at":"2026-08-06T12:54:33.643754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14324","last_updated":"2023-10-17T16:33:33Z","snapshot_observed_at":"2026-08-07T09:19:18.826470Z","submitted_at":"2023-05-23T17:54:57Z","title":"Ties Matter: Meta-Evaluating Modern Metrics with Pairwise Accuracy and Tie Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14324","snapshot_observed_at":"2026-08-06T12:54:33.744321Z","title":"Ties matter: Meta-evaluating modern metrics with pairwise accu- racy and tie calibration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.744321Z"},"links":{"cited_paper":"/paper/2305.14324","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:2c8b38c945ef367aa79a46531e2ed7df55536cdf8a969e3f669b25ba11d20081","observation_id":"9f9e2686-3aa2-4027-9f15-d3df3ff8be4f","resolution":{"observed_at":"2026-08-06T12:54:33.744321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:33.829967Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.829967Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:4bfd2c52adaacdb5ec9552b6b0fec4aeb6dc2b472dc61df1d6a1054702796b88","observation_id":"78af6481-780c-46fc-b0f7-791cee9478e1","resolution":{"observed_at":"2026-08-06T12:54:33.829967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:44.041491Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"a2b6c889-072e-48ce-a0de-fd81f973221f","year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.924185Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:515068827211facbd5f3de66a1a0733995c74732940e3c5c0e89263977c69cc4","observation_id":"c1490d63-88ed-496b-aa9e-9014014c8769","resolution":{"observed_at":"2026-08-06T12:54:44.159261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:43.754442Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffu- sion models","venue":null,"work_id":"176ba917-e957-4374-b069-e9d842094704","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.027720Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:81ae3bd61be5a82ea7ce7d103cfa426dc267dc78515281b06eb41487031fe437","observation_id":"52916587-4e53-4a68-838e-944fbb9d03f4","resolution":{"observed_at":"2026-08-06T12:54:43.900852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:43.483257Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":"5f44f272-aaf8-4b1a-bdb5-39c93b6bf2c4","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.106894Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:9503d2f41cb002b5aaadf5dcf2b2b967e9bebf1030a8a768a70765c0cc08b3c8","observation_id":"34de7a70-025e-44a6-9eb6-2c9eec8e2305","resolution":{"observed_at":"2026-08-06T12:54:43.638002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:43.254691Z","title":"Generative adversarial networks","venue":null,"work_id":"bf1c4a14-7663-4a33-99f5-d4acb2e58565","year":2020},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.174919Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:756f96cc423f2b32bfeed753de87c743b7c1c0e22339237f5969864bbf7bc31f","observation_id":"60ca7fe7-16c2-4966-bc17-8305b4f4f500","resolution":{"observed_at":"2026-08-06T12:54:43.359411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05113","last_updated":"2025-06-06T17:08:12Z","snapshot_observed_at":"2026-08-06T15:48:59.504311Z","submitted_at":"2024-06-07T17:44:32Z","title":"LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05113","snapshot_observed_at":"2026-08-06T12:54:34.226626Z","title":"Llavaguard: Vlm-based safeguards for vision dataset curation and safety assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.226626Z"},"links":{"cited_paper":"/paper/2406.05113","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:4f3110209a68ff96c45c371d9babc323fb5aa49e48c1bec3ab2be971509c2a42","observation_id":"d8979830-9d36-44d0-be4c-f66261f68e20","resolution":{"observed_at":"2026-08-06T12:54:34.226626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T12:54:34.274450Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.274450Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:4ae5ab7360eebaccfad338fa0ef7841bacddec28a31a8b1ca4387140b0323d3f","observation_id":"93f16588-f141-461c-beb4-88fdcbfe6f57","resolution":{"observed_at":"2026-08-06T12:54:34.274450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:34.347454Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.347454Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f4862bcaaf88c8a13f672362856bd91f7671d2428b0676ed34668e367a795218","observation_id":"221cbe1b-c39c-48fa-b1f5-12875ac86735","resolution":{"observed_at":"2026-08-06T12:54:34.347454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:34.455883Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.455883Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1ecd53ba0878de879de64c6323849f7f51efed28ea91f9bc07304b9c0f909feb","observation_id":"175a9c86-8bea-49fc-b5ff-ec2393d1ae23","resolution":{"observed_at":"2026-08-06T12:54:34.455883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T12:54:34.578707Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.578707Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:417eb0212da64f07d0f270c4f6d62eab8b87ae419034e5381c5548ade292f51c","observation_id":"c6bf3fea-02f6-44eb-904f-15421c7d9897","resolution":{"observed_at":"2026-08-06T12:54:34.578707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T12:54:34.709673Z","title":"Llama guard: Llm- based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.709673Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:8954ab6b952cc1e0a026deb76ecdfa1afa1cd6179a392906773a2484e25fdb9b","observation_id":"848fe526-4132-4bf4-9e22-842a315f02bf","resolution":{"observed_at":"2026-08-06T12:54:34.709673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.986894Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"c5e82883-67c1-45b7-b991-c8837169b010","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.861279Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:99203c389d6204f24c50ca7c83d80259c6d00d40cb1a2d727f88d4c7201f1bbc","observation_id":"0bc91a6b-bbdc-4591-8105-4bfd5f909bf7","resolution":{"observed_at":"2026-08-06T12:54:43.109881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-06T12:54:34.950914Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.950914Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1ebed96be937bbfbe83783f936e2ae7aa254fcaf75fc3721e51a5e54d73d92d0","observation_id":"4bf251e1-f89a-4031-8745-a2ac7ded0574","resolution":{"observed_at":"2026-08-06T12:54:34.950914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T12:54:35.047298Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.047298Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:317fb66ddf9c5042d3f61a66cbe445315c4c5e70647d450f3621322ef0fc1837","observation_id":"d72d80f3-ba3e-4c4d-9c51-5d707ddf2eb9","resolution":{"observed_at":"2026-08-06T12:54:35.047298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.672260Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"46bea5d0-1c44-4fe2-b1d2-f56c9143d560","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.145183Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f829654ab66263ebcb4f1a16999dd2d3d5f50598cf10554d8fd4a8208f076575","observation_id":"71df43e3-76ce-4791-a801-b71882b18abe","resolution":{"observed_at":"2026-08-06T12:54:42.807225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12612","last_updated":"2025-07-25T08:18:26Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T03:29:43Z","title":"T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12612","snapshot_observed_at":"2026-08-06T12:54:35.249132Z","title":"T2isafety: Benchmark for assessing fairness, toxicity, and privacy in image genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.249132Z"},"links":{"cited_paper":"/paper/2501.12612","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:0d0ff36a1d86d199ee3d24bbece483f1ab6955f90aa3ea9e1b198497a799ac73","observation_id":"bc9aae33-9a27-401b-b7c8-be632420679e","resolution":{"observed_at":"2026-08-06T12:54:35.249132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.401734Z","title":"Remov- ing distributional discrepancies in captions improves image- text alignment","venue":null,"work_id":"c7ed48e2-1534-4f32-a293-97e90ee80d62","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.362579Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:db29388335c0b973128e02546b48dd7a08d00a2997b47d364a8d1494a81fe84d","observation_id":"94664539-1edf-4155-acf0-6690ccf5666b","resolution":{"observed_at":"2026-08-06T12:54:42.539329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.169324Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"fadbd559-8d69-44c3-a9d1-711d4efc1f48","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.442644Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ece28dc69c894acae03d90d78cd152d3a52afaf9529f52e1034e2050c66cf2f7","observation_id":"337ed284-26b4-4f43-b34a-095d129c1003","resolution":{"observed_at":"2026-08-06T12:54:42.271746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-06T12:54:35.526604Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.526604Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:15e49b5ef5e3340763e4b8271facbd1ca92c3cf47889438a77ddcb044bea6681","observation_id":"0b495463-d938-487a-836d-29917f2f9c97","resolution":{"observed_at":"2026-08-06T12:54:35.526604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.914896Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"1e967a89-a9e3-4fb2-86e5-d05ea417414d","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.620233Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:04eee30c848999e0b9139fd4ec671ba8415d4cb9329d3e9d80f5d1c7c3cd607e","observation_id":"485cd105-58bf-4858-b115-6c11111da2f0","resolution":{"observed_at":"2026-08-06T12:54:42.023960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.668014Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"f29f90d1-3628-4ac9-b853-d06350b25988","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.676524Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:2b4dce12e47ce24eba894a646798272c471c4e58c295c4c89fa463f57facf905","observation_id":"0750e59b-d266-4b5c-be87-abf663dab75c","resolution":{"observed_at":"2026-08-06T12:54:41.790950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.447438Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"82789989-00e4-40b7-bc7e-f946bed3ae2c","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.725893Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:c64c6a5a3b84d2b66b55d6f7835e98bbacce46e072ac717dcc4f903f45504e31","observation_id":"e18fadd7-3903-415d-8b9c-58d5e539e4c0","resolution":{"observed_at":"2026-08-06T12:54:41.529889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:35.785004Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.785004Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:eddf74b5caf533f072264b01354394a47a4016670e370d864a5ec179c4c37beb","observation_id":"d4a9139f-d60a-4b32-a7b7-4b4aaa609763","resolution":{"observed_at":"2026-08-06T12:54:35.785004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T12:54:35.880961Z","title":"Inference-time scaling for diffu- sion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.880961Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ba583bc548c3d5f5c62738ec1cc8922ba3ae58552d1cfa17508d372df79d546d","observation_id":"af03050d-fe22-4c9c-86de-850fb1ef8d9a","resolution":{"observed_at":"2026-08-06T12:54:35.880961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.181314Z","title":"Simpo: Sim- ple preference optimization with a reference-free reward","venue":null,"work_id":"f49cfe2f-afba-49d5-bd9c-e9f14fa26d11","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.929519Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:0ceb8995dc96daf563c98ce90c77665ce9db74568bd362b3d28c766d6bd8ca09","observation_id":"90215b59-d14e-4456-8c68-0e470e90ac48","resolution":{"observed_at":"2026-08-06T12:54:41.318338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:35.985916Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.985916Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:6ae350808e53d5a516d9f114ef44b1ef2f185d8d3bf13c1b8718be9088411e58","observation_id":"1d91967a-7d25-4f32-86be-571db2738094","resolution":{"observed_at":"2026-08-06T12:54:35.985916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T12:54:36.083635Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.083635Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:c0de04d534addcdf64d6a0a8d35bea2488a542bcb18d42b53f49fa0c2a28fe96","observation_id":"7dbeb8a1-6a9a-4e17-bca3-1bd6e508fc90","resolution":{"observed_at":"2026-08-06T12:54:36.083635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.942821Z","title":"Unsafe diffusion: On the generation of unsafe images and hateful memes from text-to-image models","venue":null,"work_id":"c028a1a8-b0e5-4293-881c-e6f9f04b2901","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.177621Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ef79b913bbf8e84b363729db03254ca441040652247214b90648e55bbf785c1d","observation_id":"19a5864c-3e88-4d4d-8c3a-5565a4ec0ab4","resolution":{"observed_at":"2026-08-06T12:54:41.061472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03486","last_updated":"2025-09-11T08:50:08Z","snapshot_observed_at":"2026-08-04T06:06:53.556065Z","submitted_at":"2024-05-06T13:57:03Z","title":"UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03486","snapshot_observed_at":"2026-08-06T12:54:36.257427Z","title":"Unsafebench: Benchmarking image safety classifiers on real-world and ai-generated im- ages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.257427Z"},"links":{"cited_paper":"/paper/2405.03486","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:e789206c39ffdc16e75bdd1ab689bdff49a9e54481ecde1508e80e91b1db5778","observation_id":"486054fb-1c29-405f-a1e9-74cbe132e51b","resolution":{"observed_at":"2026-08-06T12:54:36.257427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:36.362963Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.362963Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1246b247d589956b57429947db5d7182934bdcc720380ef4b475c3a444189422","observation_id":"498d6646-c498-490b-95c6-c800bcb74c8e","resolution":{"observed_at":"2026-08-06T12:54:36.362963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.689888Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"d12c2324-d3eb-4a9d-8775-8136b88a472d","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.445317Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:6317589c0fac2674d2d2b394cd2ccaf83cb1d1dcfe738f2c6241b64e0995312f","observation_id":"95dc7cc0-f7d0-40c6-b4f4-aca3578260c1","resolution":{"observed_at":"2026-08-06T12:54:40.824402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.416721Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"9dd633e2-459b-477e-9fde-e31bb644a7bd","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.562776Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:6eb4fa5279b9147c52926645289243ca8cf709de7c0cc30d92765fbe4e8762c8","observation_id":"607b8cf6-d085-4e66-8f7e-74768b3fca54","resolution":{"observed_at":"2026-08-06T12:54:40.561887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.144419Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"79b1cb3c-9c32-45dd-8baa-dec1844cdf91","year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.684650Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:50a2db62f24ab5d010638023cc828be72630dd93874f29c442c14301952ba26c","observation_id":"dc7536f8-7fcf-463d-90d7-e39f42ce4053","resolution":{"observed_at":"2026-08-06T12:54:40.280839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.942608Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"5302e2c7-8739-48d5-94a8-c202dcc5b168","year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.771953Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f53a779457b756817ea197df07be2743d51ad2e95a1de36ccbc1563c1e73f9d0","observation_id":"c52fbfde-6f70-4c49-9cd8-36c5ef12c567","resolution":{"observed_at":"2026-08-06T12:54:40.038981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.718710Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"ead90437-1bc1-4f4e-a555-6594e0573e62","year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.863239Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:38d2a4153925b9323cab30c96181dfc25bff28e57cd8c6a490242f71c8a47a36","observation_id":"4d7867f7-2ff2-42e1-8576-59eb0668b5c0","resolution":{"observed_at":"2026-08-06T12:54:39.835962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:36.914296Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.914296Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f40dc726de827cb84a4b28088156aa521e66b29f75b3f7779feb949ddf50f271","observation_id":"f0c300b8-ddfb-44bf-b455-1d9f0393f153","resolution":{"observed_at":"2026-08-06T12:54:36.914296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T12:54:36.988698Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.988698Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:be94a816bac068e68f5bf267e49845aba97ab77d17b7ce952f521c8bbf3ef691","observation_id":"3ce9b861-b945-4995-ba66-1d41e41b7056","resolution":{"observed_at":"2026-08-06T12:54:36.988698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-08-06T12:54:37.089978Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.089978Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:fce099955be2d4aeaed1d995ce5df9946020e8c6beee046748385f1594fb4f33","observation_id":"a326a054-deaf-4fbf-8f2f-962890284bd8","resolution":{"observed_at":"2026-08-06T12:54:37.089978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.572531Z","title":null,"venue":null,"work_id":"9c5d389e-d821-4ed3-9c1e-f1d6d0d74254","year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.170906Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:4fcb189bb1b46bdd54752672fd7592e7748754d6e8e67d5dec9962b26654a2c0","observation_id":"0fb5a6c6-185f-4428-8657-6b08bb29b32c","resolution":{"observed_at":"2026-08-06T12:54:39.626966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.435717Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"91fa8030-db90-4954-a624-593f0f02d99a","year":2015},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.288393Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:46f4acb136fef2fecf9e625c0741e6e53692d9181b2431c889fa260a37a7086c","observation_id":"04f9475e-a2e7-4fcf-acdb-d64cd9abb94f","resolution":{"observed_at":"2026-08-06T12:54:39.484015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-06T12:54:37.374599Z","title":"Rethink- ing bradley-terry models in preference-based reward mod- eling: Foundations, theory, and alternatives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.374599Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ab96a1cc6097574522982c00925a6e355a7200699c46515af3c5db3b6420b27c","observation_id":"faaa401d-b7f0-4ec2-b1aa-a54f8cd4e031","resolution":{"observed_at":"2026-08-06T12:54:37.374599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16562","last_updated":"2024-10-10T14:04:07Z","snapshot_observed_at":"2026-07-06T18:35:59.208843Z","submitted_at":"2024-06-24T11:56:15Z","title":"EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16562","snapshot_observed_at":"2026-08-06T12:54:37.474204Z","title":"Evalalign: Supervised fine- tuning multimodal llms with human-aligned data for evaluat- ing text-to-image models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.474204Z"},"links":{"cited_paper":"/paper/2406.16562","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:52e1b1372ec878e0864f9482720d41cf18cb3c32c9313b72675262d49c955bac","observation_id":"ee6f6be9-143b-4030-8a6e-1d5888fb3122","resolution":{"observed_at":"2026-08-06T12:54:37.474204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15488","last_updated":"2024-11-23T08:06:06Z","snapshot_observed_at":"2026-07-06T19:55:55.658760Z","submitted_at":"2024-11-23T08:06:06Z","title":"Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark","version":1},"cited_work":{"arxiv_id":"2411.15488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15488","snapshot_observed_at":"2026-08-06T12:54:38.418348Z","title":"Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark","venue":"cs.CL","work_id":"35e7ac94-442d-429a-891b-4608b008b482","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.533704Z"},"links":{"cited_paper":"/paper/2411.15488","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:cfb4fbf88516287628ef192f48af5fb4b8c700fb6ba219275c94ac26a92f3ace","observation_id":"cf014844-e467-460e-99a7-964de4cccaef","resolution":{"observed_at":"2026-08-06T12:54:38.472533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-07-06T19:25:42.156795Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-06T12:54:37.619519Z","title":"Helpsteer2-preference: Complementing ratings with preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.619519Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:5e10c764b9e8aa470d850c03bd11cdfc82ec26ee99e36b505b7eaf8839246fae","observation_id":"0d92521d-7af7-4991-839f-b0e355584ce3","resolution":{"observed_at":"2026-08-06T12:54:37.619519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00192","last_updated":"2025-04-06T17:30:18Z","snapshot_observed_at":"2026-08-02T00:33:49.431280Z","submitted_at":"2024-12-31T00:06:04Z","title":"MLLM-as-a-Judge for Image Safety without Human Labeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00192","snapshot_observed_at":"2026-08-06T12:54:37.686456Z","title":"Mllm-as-a-judge for image safety without human labeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.686456Z"},"links":{"cited_paper":"/paper/2501.00192","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ad38fe684a7111452c052e0c1e12affbb91ef2ab4a0d8d1d50ad2aca160e4ebd","observation_id":"0649d742-b68a-404e-b33f-82115b5ade71","resolution":{"observed_at":"2026-08-06T12:54:37.686456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-06T12:54:37.787465Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.787465Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:068bb9b9cb63539287a0bcecf04a9c644dd394ea385f34fc50cf6f1e7c63c79f","observation_id":"47994f55-4f79-43be-96c8-6f0b8b3df90c","resolution":{"observed_at":"2026-08-06T12:54:37.787465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.310882Z","title":"Human preference score: Better aligning text- to-image models with human preference","venue":null,"work_id":"bde68c7f-ff07-4364-b1cf-32df46f5e6a2","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.859469Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ed70c1fa88d231b0ea97437c82fefe11afc35ebbd396432b0589c47b691bcf0c","observation_id":"55c643a1-c5da-4050-9945-d9ba9e50d216","resolution":{"observed_at":"2026-08-06T12:54:39.344930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.176233Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"7360ddde-49a3-4564-8973-e12386919d98","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.927082Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:23e9372f5e0d83559dcad7643cd926818a147d661d06d5aee9cfb99ee2d6687d","observation_id":"75506a12-6c51-49bb-ab43-87fb31752d09","resolution":{"observed_at":"2026-08-06T12:54:39.261401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.072509Z","title":"A normalized levenshtein distance metric","venue":null,"work_id":"f0e3acbb-1c2c-4f28-8ea0-bc3c4d2c5830","year":2007},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.998771Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ffa65dfb7a6d44f1d30f08ba5cb11819d7550e6f9b38e2e425936fcc811aadb3","observation_id":"3eaeffba-521a-4480-85fb-6f093aab3080","resolution":{"observed_at":"2026-08-06T12:54:39.129080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:38.901234Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"088b5812-fea5-4acd-9252-40eb86ec3d64","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.090385Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:a28ff05f27878d5634b4f8b46e198a29d3cd00e1121da7591b2cbf68e6a5b41c","observation_id":"3f3acc0d-51d8-422a-8f4f-e5647e7a1e6a","resolution":{"observed_at":"2026-08-06T12:54:38.984919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02197","last_updated":"2025-06-11T13:11:12Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T04:22:55Z","title":"Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02197","snapshot_observed_at":"2026-08-06T12:54:38.169486Z","title":"General preference modeling with preference rep- resentations for aligning language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.169486Z"},"links":{"cited_paper":"/paper/2410.02197","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ef1979bfedcdde7c6b815ee15fdad95eaae8fa92ae57b18c597fb98b78b688be","observation_id":"a5e53093-eb1b-4ff2-9218-0079c8c509a9","resolution":{"observed_at":"2026-08-06T12:54:38.169486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06169","last_updated":"2024-11-30T05:32:51Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:13:24Z","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06169","snapshot_observed_at":"2026-08-06T12:54:38.229729Z","title":"Treat visual tokens as text? but your mllm only needs fewer efforts to see","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.229729Z"},"links":{"cited_paper":"/paper/2410.06169","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f9cf78098e27eebdb9d484524b44a452e23fa443d04c9379730b15def013b219","observation_id":"b42a0d17-7f87-4a78-8598-5098a9b2a63e","resolution":{"observed_at":"2026-08-06T12:54:38.229729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:38.782192Z","title":"Towards language-free training for text-to-image generation","venue":null,"work_id":"6f758913-008d-48c1-ae4f-0f9a0e4be228","year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.274595Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:4f3e0f61c30a16f65dad510bcf3347d82046dbc7d6564b124f1abc330137c51c","observation_id":"cb6d2b9e-4aab-478f-ba2d-91070b9da082","resolution":{"observed_at":"2026-08-06T12:54:38.832890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:53:55.200265Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2507.21391."}