{"as_of":"2026-08-14T16:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da59395f1d8ea935eb9400640d4e4b2b1fefc917ffd3f341d4bcb8ace0b08227","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:16:23.050134Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.14024/citation-record","integrity":"/paper/2507.14024/integrity","json":"/paper/2507.14024/citation-record.json","paper":"/paper/2507.14024"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.522377Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"8e664529-215c-410f-9379-11d83b74ad75","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.700109Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:da2e386cfb4832013f82b476a4b379a936ac7754b0a98973c03d03271fe93f49","observation_id":"821cc9f0-5071-4f96-8c2b-52fec93721f6","resolution":{"observed_at":"2026-08-06T16:16:23.525154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.514906Z","title":null,"venue":null,"work_id":"0ea77420-ea47-44ea-86a1-393c5ba53839","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.823657Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3bc0bdf2e061d12eb999566932569602b708aa22f5309764a4c7d80e9ed769c8","observation_id":"f929e428-5e38-4144-9764-0eba9ece6d68","resolution":{"observed_at":"2026-08-06T16:16:23.517224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.507218Z","title":"Instructdiffusion: A generalist mod- eling interface for vision tasks","venue":null,"work_id":"0a0a8ef4-6432-4988-b958-bba0ed14437a","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.893932Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3187251e72e355ff8f473befdea91c4c58efa613906f5c3496509672c0e00d16","observation_id":"b52660cc-eedd-4bad-bb16-5c83c1c235a9","resolution":{"observed_at":"2026-08-06T16:16:23.509918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T16:16:22.897633Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.897633Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:e1cf38195a7ef758b847e0360e09a8569a7f4ff5a02b18044e560f73cc93f89c","observation_id":"042033a9-05c0-4e89-9016-7eef99e45cf9","resolution":{"observed_at":"2026-08-06T16:16:22.897633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.499213Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"19be1d4b-41af-40be-a5cd-aa5f99f2b896","year":2014},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.900707Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:47212077ceaedea67faf7a82d9cc2837d5efdc1df36cc0ee282a70d932273f92","observation_id":"524f47fe-a751-474a-a0aa-288bf8f9b749","resolution":{"observed_at":"2026-08-06T16:16:23.502254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.490950Z","title":"Universals and cultural differences in the judgments of facial expressions of emotion","venue":null,"work_id":"db446710-b5fb-4bb4-9332-d64e5c01548c","year":1987},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.904130Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:404fc92fcadd49198245f0ef4ded94471b51221327cee38ade40851ced56a7d9","observation_id":"b521dfd6-01cd-4368-b52b-70df2d232d13","resolution":{"observed_at":"2026-08-06T16:16:23.494205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.482770Z","title":"Affective image classi- fication using features inspired by psychology and art theory","venue":null,"work_id":"f46ba928-43f6-4be8-9f93-01622ce0cc96","year":2010},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.907586Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:6ec371fddd8af85010f9fa778855c89aacbf79e657ae1b7c4f7d296205cf0e16","observation_id":"4656edef-6dca-46c2-bf62-0c29056f0ddd","resolution":{"observed_at":"2026-08-06T16:16:23.485713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.475150Z","title":"A mixed bag of emotions: Model, pre- dict, and transfer emotion distributions","venue":null,"work_id":"6e6b2c38-bfdc-4c08-b843-6cf89d0f9077","year":2015},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.910142Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3facb7807a3d743bef3c4fb115ce7b241a48a8798906f51a4f2d9ad9a77b0079","observation_id":"feab293a-124a-45e6-8b97-1b440516731b","resolution":{"observed_at":"2026-08-06T16:16:23.477826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.467355Z","title":"Emoset: A large-scale visual emotion dataset with rich attributes","venue":null,"work_id":"83050101-b9e9-4aa8-942d-0b0a476b74ae","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.912712Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:585fef180c19553743dc4a590dedcbe5b7584c4c3877268f99c59735005bdcb7","observation_id":"41bc7bd8-c63c-43f2-986f-2d5dbe2ebe29","resolution":{"observed_at":"2026-08-06T16:16:23.469990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.459348Z","title":"Context based emotion recognition using emotic dataset","venue":null,"work_id":"e7448fa6-5e68-418a-aa43-6dd8b741722b","year":2019},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.915705Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5ae268818bd36d4408d7f838ebfc1f896b92ec5705a0d026bd0fdf9a0567b837","observation_id":"e14a39e9-8b18-409b-9bd3-98c95ecedd86","resolution":{"observed_at":"2026-08-06T16:16:23.462493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.451327Z","title":"Affection: Learning affective explanations for real-world visual data","venue":null,"work_id":"7fb837ef-768f-43cc-a37f-de3493754d80","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.918286Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5168104c21a2d2bd8023774037d1a5bed088107356e2d96bb52b878a4a046db3","observation_id":"2c3f3505-e9d2-4a31-8d0c-b20e4d07b3fb","resolution":{"observed_at":"2026-08-06T16:16:23.454385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.921128Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.921128Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5fd3b738f19482d57cb6d65e8ba5895d9361ebde2c0ffd459e14eff87834838f","observation_id":"bb7def94-8608-4d08-a9b6-49c99aac00c2","resolution":{"observed_at":"2026-08-06T16:16:22.921128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.438623Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"91ae4a78-6811-45e6-8ded-9f7e0a8cdaa5","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.923806Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:68422f5359ad520415ac709431fd5f1005ae8c5c3dc9475c405fa0f7b3e90222","observation_id":"56efe553-bb1b-4a3e-98bc-d3e76e738786","resolution":{"observed_at":"2026-08-06T16:16:23.441359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.430741Z","title":"Grounded language-image pre-training","venue":null,"work_id":"394bcd39-1add-47ad-b700-f29f1374ce0d","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.926795Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:6e1f26101701bf4977421327e47cc588143d01edc05ec48b7072b7234f325790","observation_id":"c851383b-aca0-4240-9b7e-f9af124d413a","resolution":{"observed_at":"2026-08-06T16:16:23.433604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.422917Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"48dba22b-8994-4386-a0d7-3df7373a977f","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.929566Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:612bfac8cce29270f6fa2d7c656be29ecaf2a383b12f8ffb32f0c8993debc18b","observation_id":"8c5ef576-b4fb-47e0-8af1-68039c4de425","resolution":{"observed_at":"2026-08-06T16:16:23.425594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.932209Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.932209Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:ab7e6865e65d496b09d36c8dbb4a7d432f68171dba5d8ff9d3e0748327df3082","observation_id":"bf768030-7b73-4354-aa4a-b9f17597512f","resolution":{"observed_at":"2026-08-06T16:16:22.932209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.410164Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":"885438fe-5605-4de8-a981-695feb0312c4","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.934777Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:fb0f6cb2b5b853328252121539803fc17e6b8c8814b17bb22a89347400728013","observation_id":"f9aaf3f0-5632-4102-90d8-502afd57d682","resolution":{"observed_at":"2026-08-06T16:16:23.413095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.402974Z","title":"Videoclip: Con- trastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"00b04320-b4da-4a9a-b6c8-3b6e144ee8ae","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.937349Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3aecab1d87929252c87e1b1d71a24f13b699d25aa69af7fa9ce60288b6f56e56","observation_id":"64833246-9026-44be-9759-88232931f634","resolution":{"observed_at":"2026-08-06T16:16:23.405627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.395843Z","title":"Vqgan-clip: Open domain image generation and editing with natural language guidance","venue":null,"work_id":"8cab994b-1fcd-4c56-867e-f9641e5e2874","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.939956Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:480a7a21c148b499e71b6eb268ec59a58110aed703f7caa5fffb6dd03040cec4","observation_id":"2f283955-ccc4-4bcb-a7db-bf489c22a17a","resolution":{"observed_at":"2026-08-06T16:16:23.398373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.388340Z","title":"Clipdraw: Exploring text-to-drawing synthesis through language-image encoders","venue":null,"work_id":"bb4d73ab-d2ad-45e7-8882-0db9937eddff","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.942557Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:7729a0fc9ba2b6cbf4fd63a6ae6d9ead02e1a4633961e6bb1accf68bd46ff099","observation_id":"e6ce5e30-90f5-4840-acd9-bf4bd395583b","resolution":{"observed_at":"2026-08-06T16:16:23.391083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.380757Z","title":"Clipasso: Semantically-aware object sketching","venue":null,"work_id":"d8b53f2c-c79d-4563-8ab2-e364bd8a4097","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.948318Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:411072a166f20143cdf2c172086ee496b57420c029c4fb3351750e8a91c73b78","observation_id":"4ab5a89c-71cf-4c5f-bd9f-20b442a3dfd5","resolution":{"observed_at":"2026-08-06T16:16:23.383426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.373108Z","title":"Region- aware pretraining for open-vocabulary object detection with vision transformers","venue":null,"work_id":"0324d4bf-ce0e-4dc4-a9d0-85531ca469e4","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.950693Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f09ff691a3feb890ef09f173528b89c15979495ff19fc7082df707621cb6715b","observation_id":"3dd52f12-982c-4948-9b87-3e461fbcac4a","resolution":{"observed_at":"2026-08-06T16:16:23.376124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.366109Z","title":"Multi-grained vi- sion language pre-training: Aligning texts with visual con- cepts","venue":null,"work_id":"6137bdf4-be9e-47e8-b418-c55f89848ffb","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.953442Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:a0940259f41350360314b50cf1b4e203f0b67de2fbcc536b771682edb8733661","observation_id":"05342b86-a399-4be6-92f8-3820cb0c2041","resolution":{"observed_at":"2026-08-06T16:16:23.368495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.358722Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"91d4db87-74f3-4efa-87ac-4b8855c3ba28","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.956187Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:2314cc0f297cdb2f3b055732e8ba59621593a00184d87dc3a48a1a8f893d9e43","observation_id":"f800d127-454b-427a-88c9-2d3fe836f80c","resolution":{"observed_at":"2026-08-06T16:16:23.361258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.350423Z","title":"Stablerep: Synthetic images from text- to-image models make strong visual representation learn- ers","venue":null,"work_id":"42069bcf-cfc3-416e-b809-d033d7d6eeed","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.958717Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:1954dd796ece94d94df651d5ddc01199aeae7484e06433e565a72dfa8b74ae30","observation_id":"43e7e8bf-2377-4353-b572-70111141dc60","resolution":{"observed_at":"2026-08-06T16:16:23.353012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.342239Z","title":"Alip: Adaptive language-image pre-training with synthetic cap- tion","venue":null,"work_id":"55ea75c5-01ef-4a5b-b0ed-ddf5d807f354","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.961302Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:635b1f149749e15c7d1bf41cd51d21182974fde1e2bc78e8d072a96697e444c8","observation_id":"1e267e81-e89c-4c2d-88e6-b20a7ab52498","resolution":{"observed_at":"2026-08-06T16:16:23.345065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.334429Z","title":"RLEG: Vision-language representation learn- ing with diffusion-based embedding generation","venue":null,"work_id":"8f45e0bb-490c-4bc4-a32d-e1b0886cf99a","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.964447Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:584fbe11199334fb81daa10a56b0ff851e1a4a5548c434f0d686050d6e87ca9d","observation_id":"5525f636-7d3c-4d40-9bfc-b93d62dee74d","resolution":{"observed_at":"2026-08-06T16:16:23.336978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.326107Z","title":"Veclip: Im- proving clip training via visual-enriched captions","venue":null,"work_id":"dfba613a-b4f5-46a9-a098-8baee354464d","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.967196Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:ef0c25dea61b119ee538f5c78bec31229ea218084916edabab3d02237ed22046","observation_id":"9df5f5f0-c038-4c0a-93ee-b99d4e58a5f3","resolution":{"observed_at":"2026-08-06T16:16:23.328942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.317973Z","title":"Mllms- augmented visual-language representation learning","venue":null,"work_id":"c56847ff-f895-4204-88ec-3e7434c38b5c","year":null},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.969973Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:60bc880ae81550f5a589f143fb1e79f700f55e85344e2098a7d2e32ed111aa05","observation_id":"0b995753-f662-4432-9d04-10fb5ac59f67","resolution":{"observed_at":"2026-08-06T16:16:23.320446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.310294Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron C","venue":null,"work_id":"c5cd5a5a-a8b4-4c3a-b182-2309be1d3a30","year":2014},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.972688Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f687bf82d5f5ca27ff4706ae2278e940a3a4aafbd0d74ebaba029f1d8781aac0","observation_id":"2cf9fdd8-a940-4787-903f-801da675c4a4","resolution":{"observed_at":"2026-08-06T16:16:23.313120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.302351Z","title":"Reed, Zeynep Akata, Xinchen Yan, Lajanugen Lo- geswaran, Bernt Schiele, and Honglak Lee","venue":null,"work_id":"d524780d-d9a4-49d9-a4ff-489f784c0424","year":2016},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.975283Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5c006c6c30977fe7fd3c75aeb8b6651bc98335799f3b4b7ae20893ea552dc34d","observation_id":"b044a504-a4a0-4db3-9446-a204010df3bc","resolution":{"observed_at":"2026-08-06T16:16:23.305593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.977966Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.977966Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f09e636cdcade8f01ae7853e69b2a8c8384197f2d0330ceef9d1843a4daa28e0","observation_id":"bdb60db8-e0fe-4641-b12a-d2d8268f44fc","resolution":{"observed_at":"2026-08-06T16:16:22.977966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T16:16:22.980516Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.980516Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:658c3a5c7d88c09ecaa715b46904d0bfa51c62e21f917bc76e3029e4636108a3","observation_id":"f82156c4-3ac2-42c8-a87b-57084fd48ff8","resolution":{"observed_at":"2026-08-06T16:16:22.980516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.983166Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.983166Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:c88dd7c3367c702a0bd60b90e5c71d49ed05dea908df2995c4d360dc73a27fd1","observation_id":"58d6efec-63eb-41b1-92ad-49de25994675","resolution":{"observed_at":"2026-08-06T16:16:22.983166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.986293Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.986293Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:c434b0fb129d53c7e57289fdebb44ee4ccfd4178e4945b58455f8629977d1791","observation_id":"336a6147-1e40-4f4d-ad36-fa56875aca9c","resolution":{"observed_at":"2026-08-06T16:16:22.986293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.279268Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"d1f794ea-96f7-4683-93dc-fe0e7f0bb3a3","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.988791Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:0fd1beb7cb62998bcbd61f70c9e104d77f6402e303d458adac3e1ef30b95a8de","observation_id":"e5d9f01e-99c7-4b08-940a-4189b236a360","resolution":{"observed_at":"2026-08-06T16:16:23.282580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T16:16:22.991338Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.991338Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5bc962fcd06a20de0291e9db987f39c18a064f48a356ef9feffa56981de3061b","observation_id":"88fccf6d-3ef2-43aa-86bf-7647ef034a31","resolution":{"observed_at":"2026-08-06T16:16:22.991338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.270949Z","title":"Imagic: Text-based real image editing with diffusion mod- els","venue":null,"work_id":"243e1c56-fd68-444e-8b89-3e0734c9b5f4","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.994219Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8e18200d4b3cb5da868c191666a95f649ae9abc230dad982fdcdfa4aaf33d959","observation_id":"a25692c1-301f-4515-8cfc-11db904a8bf8","resolution":{"observed_at":"2026-08-06T16:16:23.273569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.262221Z","title":"Photoswap: Personalized subject swapping in images","venue":null,"work_id":"4a7c0dea-72d7-4452-8608-ab46165a53bd","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.997101Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:cffc71e545b884e291717c6480435f2b8e90fc119d6e003dea984e497130cd88","observation_id":"b8371a56-ff60-49a5-a60b-b0b7ada78187","resolution":{"observed_at":"2026-08-06T16:16:23.265754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.253469Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":"62424662-0f47-494f-9cfc-633d375a4d86","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.999712Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:6898aff39d803b71ba9d7d4e771e3495cd568dcd7f1820921b6934e098bb0950","observation_id":"4cad8d5d-2db5-43fa-9c22-1bddacf57aad","resolution":{"observed_at":"2026-08-06T16:16:23.256965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.244695Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"65a58bbd-4adf-4256-912b-d9c3e2e44c9f","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.002237Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:2aa927e61377a1a9247c7e8910bfa8d629556c6e036825b8eb5540e372aee5fa","observation_id":"4bb41fd0-cda5-405a-81e8-cd574d17da4c","resolution":{"observed_at":"2026-08-06T16:16:23.247595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.236087Z","title":"Fleet, Radu Soricut, Jason Baldridge, Mo- hammad Norouzi, Peter Anderson, and William Chan","venue":null,"work_id":"8171e743-c39f-4ec1-9ffd-aeb65d16d983","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.004766Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:80c50ccc9a514b8fa5d71d27318361c76b377258d3a38584e36bfb282e6b6d7d","observation_id":"50ec6452-b21b-4c83-b3c5-c9d64571ff58","resolution":{"observed_at":"2026-08-06T16:16:23.238884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.227368Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"df2043e3-2ccf-49f3-89dd-5f6ec7dd8f79","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.007795Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:c433323f8bbff9cecd5ac2c976e30ca1c2d8bd88fc0eefe390849d75f59d7462","observation_id":"24031552-64b3-4588-ae3e-1dbd4feb14c7","resolution":{"observed_at":"2026-08-06T16:16:23.230749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.218637Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":"d34d55c4-b4c5-46d1-8694-b553dfe14615","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.010426Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:48ce84a20b42b3f51c60bb466d27ab4d47d7ed1e78d3a850bfa552da51dfe63f","observation_id":"b3918f07-5bcf-4b62-8425-5fd8ab8d8395","resolution":{"observed_at":"2026-08-06T16:16:23.221583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.208603Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"c7f17838-b277-40b1-be13-feb3bfc3f094","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.013690Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:77f4a585f6f70f82ff1f448b3dcc9ac1a3e947bfc799ff89a87346a4bdf2fc37","observation_id":"ec173cb1-b0de-4fc0-9a88-f046d41c6a97","resolution":{"observed_at":"2026-08-06T16:16:23.211674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.198668Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and edit- ing","venue":null,"work_id":"b1f139e2-0494-4ab7-a911-3e26dbd30567","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.016807Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:e9b8021ed623cd1ee51df57c75ebdb5172441ca6553642640a941ee9f686f366","observation_id":"a2f7ea8d-b6d0-4902-bf08-99cbe78be2e4","resolution":{"observed_at":"2026-08-06T16:16:23.202121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00547","last_updated":"2020-06-03T00:31:11Z","snapshot_observed_at":"2026-07-06T09:16:56.708811Z","submitted_at":"2020-05-01T18:00:02Z","title":"GoEmotions: A Dataset of Fine-Grained Emotions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00547","snapshot_observed_at":"2026-08-06T16:16:23.020247Z","title":"Goemo- tions: A dataset of fine-grained emotions","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.020247Z"},"links":{"cited_paper":"/paper/2005.00547","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:d0cb675842cf2111fac8f67059ff4f1a5839eda11e96f9c3feba5a6dca0db558","observation_id":"ad029215-a9a1-4075-864e-e0ea22373327","resolution":{"observed_at":"2026-08-06T16:16:23.020247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.023182Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.023182Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:6ec75bfca8fc38cbd2cfe70b51c5e022e338538d83ebb116187ea1f47c52122f","observation_id":"19a21e28-c53a-497e-b4c7-e81634cf8f07","resolution":{"observed_at":"2026-08-06T16:16:23.023182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.184611Z","title":"Long-clip: Unlocking the long-text capa- bility of clip","venue":null,"work_id":"fc8a0bd5-08fe-4282-af1e-569a7485e474","year":null},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.026065Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:70bcdaf78dc34608aa3227574a4ef93b9cc8c8566840abb7591397c6c0aa555a","observation_id":"213342d9-5c3d-45b6-8e79-b8d2cf2034ec","resolution":{"observed_at":"2026-08-06T16:16:23.187454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.176127Z","title":"Ot-clip: Un- derstanding and generalizing clip via optimal transport","venue":null,"work_id":"825eeea8-490d-45b4-8952-26190f7d60da","year":null},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.029267Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8353b89d3257f5f5c8e6c7efe554d30b510e3cfb9107667372a235219db54a8b","observation_id":"fe8f3162-2965-43bb-bba1-c27873d74269","resolution":{"observed_at":"2026-08-06T16:16:23.179136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.167862Z","title":"Inversion-free image editing with natural language","venue":null,"work_id":"7dbbf0db-77ef-482c-baf5-de20f42b9cf8","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.032328Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:6a71a3897f37543105a2e5447f25bdb292442f6eb799046a0fe1b6e338b03282","observation_id":"079df2a0-8ea6-46e6-ac02-67fdb359c453","resolution":{"observed_at":"2026-08-06T16:16:23.170587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.159336Z","title":"Senticap: Generating image descriptions with sentiments","venue":null,"work_id":"4995a6b0-c5ba-40f1-ab5c-2b97479998b1","year":2016},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.035077Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:059ca6e6a50df12c96dbc2203d45fc2667f5d97f9a0d24eb94532241d8a1261d","observation_id":"ceecab97-b51e-4182-b627-727dfcbb5bfe","resolution":{"observed_at":"2026-08-06T16:16:23.162283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.151069Z","title":"Guibas, and S","venue":null,"work_id":"fea1d4b6-6438-443b-9357-964cc3e8120e","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.037817Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f1d1339ca49a53046bbfefd1cfc80d8ce3b625efa312869654f4a18f8e806821","observation_id":"1cb4b0b0-7099-4256-94c6-899afefa74bf","resolution":{"observed_at":"2026-08-06T16:16:23.153802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.143042Z","title":"Kulikov, and Tomer Michaeli","venue":null,"work_id":"131c6301-0cb3-408d-91d5-cf35d465bae7","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.040554Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8ea963cbf41f291356f4afd6c0665505646064b35b4cecc623e6c7fd0760bec2","observation_id":"f82649d2-b14a-4b34-b85f-546c803673c0","resolution":{"observed_at":"2026-08-06T16:16:23.146031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.133962Z","title":"Stylediffusion: Controllable disentangled style transfer via diffusion mod- els","venue":null,"work_id":"7af1618f-b722-4e03-94fa-8b485d73c7d8","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.043323Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:6891e8b6db41eae93547da0e64bcbeee133fbd67e582a16b590678b0d151be7e","observation_id":"c7e8ae43-83be-4772-8ae6-671609759560","resolution":{"observed_at":"2026-08-06T16:16:23.136796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.124697Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":"03258576-1b91-4adb-83a6-201e926978d9","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.046690Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:17ee57fe901d79ee0a64c06c1f9b8b04ba950540e260a90c93fe648f028d10d0","observation_id":"1cf93478-9c47-474a-8820-03d88ebbef93","resolution":{"observed_at":"2026-08-06T16:16:23.127688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.113628Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"b38831c9-fe9f-4352-a832-859626b64bcf","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.050134Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:56b01d880eb5c1e6f72120ee7b9c3eef385399d84f63eaecd9ace7875eb31081","observation_id":"57e5f660-28b4-421c-aeac-90968aed223c","resolution":{"observed_at":"2026-08-06T16:16:23.118016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T16:34:33.031459Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.14024."}