{"as_of":"2026-08-10T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5dff7662e3b98d5dfb621926b76e92df144919086e000cde98a1f8be13fb473","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:15:50.308478Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04378/citation-record","integrity":"/paper/2509.04378/integrity","json":"/paper/2509.04378/citation-record.json","paper":"/paper/2509.04378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.109062Z","title":"A model of aesthetic appreciationandaestheticjudgments,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.109062Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:de2acfc228806fec72ae49d760d284010095cb7b60225e7b7a42a4c74affeef0","observation_id":"6f11d397-4e42-49ab-95f9-492a20b517cc","resolution":{"observed_at":"2026-08-05T10:15:50.109062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/e514602010-003","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Prospectsforacognitiveneuroscienceofvisualaesthetics,","venue":"PsycEXTRA Dataset","work_id":"43c1ad32-8510-49f7-a74f-838af30a7758","year":2003},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.114213Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:410feccc163f64e80b79fbc84ec201300a4a811778100b20a914062e187b24dd","observation_id":"5e9b9129-4b57-4aae-9b67-5b3d269be6ab","resolution":{"observed_at":"2026-08-05T10:15:50.415002Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.32015","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.693406Z","title":"Comment-guided semantics-awareimageaestheticsassessment,","venue":null,"work_id":"a304fef2-d236-4f07-a757-0561ee29afd0","year":2022},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.119507Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:91c555526cae2e4a6961c49a0c83936b75cca029d035869b15a6d196758f14c9","observation_id":"aa2495ca-a659-4b13-a117-07f58717b411","resolution":{"observed_at":"2026-08-05T10:15:54.700905Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.11022","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.568392Z","title":"Confidence-based dynamic cross-modal memory network for image aesthetic assessment,","venue":null,"work_id":"3610b9d1-72d4-42e9-8864-bac469d4248a","year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.128555Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:61c20df0c9728499e12217b098f3f40c36a570628688f4753faff82fe5b18dfb","observation_id":"a1b23c3b-0495-43b3-bb10-468f20e8cdbf","resolution":{"observed_at":"2026-08-05T10:15:54.575311Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.132876Z","title":"Aesclip: Multi-attribute contrastive learning for image aesthetics assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.132876Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:dfd28cec0bb3dae0b3cd0a806997d833c2f4322633a036c6dfa4d98c5cf5d6a6","observation_id":"dfc814f8-c62b-4cb5-a246-fece044839ed","resolution":{"observed_at":"2026-08-05T10:15:50.132876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.414436Z","title":"Image aesthetics assessment with attribute-assisted multimodal memory network,","venue":null,"work_id":"fc77c97a-0a02-4e44-83db-0a940c22efd6","year":2023},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.137788Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:a151c2a14c83d1e2044ca042c0a1656bdff50ef4e3a869d29534286634dfdf26","observation_id":"c5046b7c-fc8b-42a7-a329-d100ed516484","resolution":{"observed_at":"2026-08-05T10:15:54.419039Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.238458Z","title":"Enriched Image Captioning based on Knowledge Divergence and Focus,","venue":null,"work_id":"89ce36db-e9d8-4c20-875b-f16a0e8e5304","year":2025},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.141927Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:fec2691f9272ae7501e6b02250ca93afbcd29cb9f5ee3254d3cf85a79cbbe174","observation_id":"af503ce6-6cdb-46a9-acf1-0d76a0eace6b","resolution":{"observed_at":"2026-08-05T10:15:54.242750Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:53.925913Z","title":"Aesthetic image captioning from weakly-labelled photographs,","venue":null,"work_id":"1342d4d6-3ffd-4a9d-bbd6-d0a81af6e062","year":2019},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.146074Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:9572de690e5c351f2953a33f53f56c3a20327f8804a05a589672ec3a44ac77d2","observation_id":"edff4110-ea54-4803-91ac-138a3e6a5012","resolution":{"observed_at":"2026-08-05T10:15:53.931430Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:53.755296Z","title":"Generating aesthetic based critique for photographs,","venue":null,"work_id":"831795ed-b0e4-4c2e-a1a2-d0ebc297a964","year":2021},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.150286Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:bf7e2d417f1797052839750bd3804ef9c16cafa2d786446f72a10963df7fe774","observation_id":"7de4e57f-187d-4c94-a2fa-3380edaa902b","resolution":{"observed_at":"2026-08-05T10:15:53.761312Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09619","last_updated":"2024-04-15T09:47:48Z","snapshot_observed_at":"2026-08-05T00:53:20.602420Z","submitted_at":"2024-04-15T09:47:48Z","title":"UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09619","snapshot_observed_at":"2026-08-05T10:15:50.154773Z","title":"UNIAA: A UnifiedMulti-modal Image Aesthetic Assessment Baseline andBenchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.154773Z"},"links":{"cited_paper":"/paper/2404.09619","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:76abc86295ac2630d8bb7d59e7fdb9fc8bd72bb2be70c3949189040d55cc6087","observation_id":"983ba80a-6ef3-425a-a67e-a8ce5fdd4a7f","resolution":{"observed_at":"2026-08-05T10:15:50.154773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.827231Z","title":"Studyon the Image Aesthetic Assessment Based on Saliency and Attention,","venue":null,"work_id":"e4c39846-f4d6-4c87-afef-b35f388be0fa","year":2021},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.159265Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:361ee7594de267dc78b86cd4e55fe76b84b1d5aae6e48d072569a0b37d36594b","observation_id":"f0651570-d054-48a1-b57a-895d12acddbd","resolution":{"observed_at":"2026-08-05T10:15:54.831787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:53.552603Z","title":"Eat: An enhancer for aesthetics-oriented transformers,","venue":null,"work_id":"b6726162-2166-47a0-bfb1-e614441150ff","year":2023},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.163273Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:8094d81d9b8ddca077844274b6c3f567db92439bd46699fd130ff811f63597d7","observation_id":"177129bc-0531-4aa3-9604-7c97d7f39b1b","resolution":{"observed_at":"2026-08-05T10:15:53.559324Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:53.335759Z","title":"Multi-Modality Multi-Attribute Contrastive Pre-Training for Image Aesthetics Computing,","venue":null,"work_id":"7df3e778-d51a-4ff5-881a-3cdd6188d9b2","year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.167313Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:3c22e044d14e78ae92317bd2e40824125992c19a40eef19250fe839110ec029e","observation_id":"8d88295b-f7d6-46e7-b826-4963ca5558df","resolution":{"observed_at":"2026-08-05T10:15:53.341093Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.171559Z","title":"Aesthetic critiques generation for photos,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.171559Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:b9205892e3aaffcef90bd2de9cf00f633698e9ec818807ad85e83a80ea455f11","observation_id":"e898eb77-c809-420a-b88f-2f6530d5b01d","resolution":{"observed_at":"2026-08-05T10:15:50.171559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:52.959331Z","title":"Neural aesthetic image reviewer,","venue":null,"work_id":"ddd476e3-c45a-4b77-ba6d-1aef08c1b243","year":2019},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.175687Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:a91508a86c63c4bf30dc82f16e29df4a0d637ceb68d4aa6b3f52fca469ef3520","observation_id":"0cf81da5-bbe3-484d-8ae7-3d72392ec80a","resolution":{"observed_at":"2026-08-05T10:15:52.967030Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.813251Z","title":"Latent dirichlet allocation,","venue":null,"work_id":"7d7673fd-d2f5-45e6-bcf4-6739443d0690","year":2003},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.179930Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:d028394aea01f410ee3ea2a39a4000e455a9468917e9331fe77a83eeb0dd5b8a","observation_id":"0be009b3-4e2e-4000-9190-cdf3aaf1e701","resolution":{"observed_at":"2026-08-05T10:15:54.817454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:52.745151Z","title":"Aesthetic Attributes Assessment of Images,","venue":null,"work_id":"45f17558-4224-4738-9721-38ff30131e3c","year":2019},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.184047Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:b12e8fd0b7a3cae187103544d5cc007e106a889af0b1316bb5b0a1eb1607cdef","observation_id":"2033a8ee-6b0b-4c0b-8be1-59e90cf2d985","resolution":{"observed_at":"2026-08-05T10:15:52.749788Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:52.537950Z","title":"Towards personalized aesthetic image caption,","venue":null,"work_id":"57ef81a9-2d2f-47a4-9525-e6ac983ca855","year":2020},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.188467Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:d44f0d95fcba4f724e5ccf3d2b27b74e70fff0771cb3df13ebb3edf4e2742488","observation_id":"d413741d-c9f9-40ea-a8f8-e61fdbbfa0d7","resolution":{"observed_at":"2026-08-05T10:15:52.542569Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:52.348409Z","title":"Understanding aesthetics with language: A photo critique dataset for aesthetic assessment,","venue":null,"work_id":"58925636-354a-4232-9472-42f7e57d7971","year":2022},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.192260Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:860fdbb359bda7210ffc1172ce32b42bddf6feb1e890bb905c4cc29a3f84de16","observation_id":"a5fe8234-6e7b-4c1d-9dba-0f7f394a62ff","resolution":{"observed_at":"2026-08-05T10:15:52.353366Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:52.149519Z","title":"Aesexpert: Towards multi-modality foundation model for image aesthetics perception,","venue":null,"work_id":"4cab0330-1dfd-4e63-83d2-a234fb1058fb","year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.197002Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:f581b5f8fdbba74210236b8a0cf249693b8b04876478527cd0e2dbcd5bdcda58","observation_id":"5112d0de-53cd-4969-9089-3a4d41121a0c","resolution":{"observed_at":"2026-08-05T10:15:52.154196Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:51.994467Z","title":"Saliency-enhanced image aesthetics class prediction,","venue":null,"work_id":"f85c6353-95c6-4dc7-94b3-41c1503e34d5","year":2009},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.201185Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:40a28a08c678d6f6130c0e099fc5d64141ba0828feda844fd590c0cfd382be49","observation_id":"b17190f5-f994-4969-b1cc-13bd0668cd91","resolution":{"observed_at":"2026-08-05T10:15:51.999098Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.795502Z","title":"Research on Image Aesthetic Evaluation using Image Scene and Saliency Information,","venue":null,"work_id":"5d75c0e9-5713-4914-8598-2231a7b64cdb","year":2017},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.205273Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:eca325fa7d0f382329d5f2e3dae7ad665e11984dbaff4fcdc0faa00baff7e051","observation_id":"b36771c3-7a0c-4686-9a30-a4fde45023e3","resolution":{"observed_at":"2026-08-05T10:15:54.802642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.781984Z","title":"Research on image quality assessment and improvement algorithm based on aesthetics,","venue":null,"work_id":"e35dbb6b-6674-46e1-92a4-0cf4b1125483","year":2021},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.210109Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:7df1dff21aeaa23a4581810b2cd1a6fd83e6a814563614623ce8092a1b55f05a","observation_id":"15b830e8-0db4-48f3-b9b0-4617787b8936","resolution":{"observed_at":"2026-08-05T10:15:54.786835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:51.816453Z","title":"Imageaestheticsassessment based on multi-stream CNN architecture and saliency features,","venue":null,"work_id":"35e79078-afdd-43a5-befe-153c6a022953","year":2021},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.213993Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:f66b37d59d55465e3eaad9c67b22d0792989a1511dae74f0188fa92cfa3df4eb","observation_id":"7e62b708-cc44-4d22-b0c2-c0cdf586e280","resolution":{"observed_at":"2026-08-05T10:15:51.820763Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:51.618323Z","title":"Co-salient object detectionwithco-representationpurification,","venue":null,"work_id":"d47fb849-933a-453d-9523-4083e6c370bd","year":2023},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.218024Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:c1cb992356ef205e424275a8f5c3b9b3f9086701c69117bca1acfa7358a6bb24","observation_id":"f87e9ba4-8e15-4375-bf0a-f79379a9b89f","resolution":{"observed_at":"2026-08-05T10:15:51.622802Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-01240-3_23","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:08:14.039542Z","title":"Associating inter-image salient instances for weakly supervised semantic segmentation,","venue":"Lecture notes in computer science","work_id":"69a4c815-8da4-4ecc-99ac-4a6daeb57a08","year":2018},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.222247Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:da53bdc6c640bed4b1aa36949025b922d15085a5185fcfd742eb103c7a91e71b","observation_id":"e1ac556f-088c-4b9e-9fc0-fa60b5e5f8cf","resolution":{"observed_at":"2026-08-05T10:15:50.392512Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.226237Z","title":"Texture-guidedsaliency distillingfor unsupervisedsalientobjectdetection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.226237Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:cc477f5e5899efc3971a50b283cdc2b1a5f1342e7357fad56b51ee662f380016","observation_id":"0cb6c15e-8831-4993-bce9-f71d70e7a4ab","resolution":{"observed_at":"2026-08-05T10:15:50.226237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.imavis.2009.06.006","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Human detection using a mobile platform and novel features derived from a visual saliency mechanism,","venue":"Image and Vision Computing","work_id":"8d34dace-7f6a-4cef-8abb-1451626b8d52","year":2010},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.230538Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:70b435306ff4a7906ee649fd157ddfee8c45a53cde26adb189ca876ee99acf16","observation_id":"51f568d5-315a-4e29-a447-415ce2c8273c","resolution":{"observed_at":"2026-08-05T10:15:50.377998Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.235093Z","title":"Rethinking Image AestheticsAssessment:Models,DatasetsandBenchmarks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.235093Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:2c8a5e9c5645886de790ff15771713cb440d5342f9f5c682146103cb3953aab8","observation_id":"07a8bc35-86bd-40f9-8883-dc8755b5c61c","resolution":{"observed_at":"2026-08-05T10:15:50.235093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:51.351797Z","title":"‘Special Relativity’ of Image Aesthetics Assessment: a Preliminary Empirical Perspective,","venue":null,"work_id":"3157ea4e-36c4-4fe2-84ee-42a7db20f1e7","year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.239250Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:480eed27ba33df504d1cee0514db64b451fbff0d1a3bf999faf513f14a162e91","observation_id":"93ee8013-6225-4958-9218-d895a46981e5","resolution":{"observed_at":"2026-08-05T10:15:51.356940Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T10:15:50.243414Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.243414Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:acae5f2051075f2aa1218a49d606d1846781eb4962c60c2438f8d82016f5db07","observation_id":"4e5b42c3-1eff-4485-8534-549d3254f274","resolution":{"observed_at":"2026-08-05T10:15:50.243414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.767829Z","title":null,"venue":null,"work_id":"9d439761-ce8e-468f-8156-21d705ae5fc5","year":null},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.248063Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:5deabde4177842cea92bbb1434ebee3c91d1dfdfce6aaf0c11db7463d104da41","observation_id":"a0207f54-105a-452c-8826-2e21c06192cd","resolution":{"observed_at":"2026-08-05T10:15:54.771981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T10:15:50.252054Z","title":"Internlm2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.252054Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:c70c69b98f5aa541a56027bcb8078712aa1faf524e44072d3a9a4c823d43ac2a","observation_id":"f14f4882-d36e-4e59-aea2-dcf53c76e976","resolution":{"observed_at":"2026-08-05T10:15:50.252054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:51.144655Z","title":"Layercam: Exploring hierarchical class activation maps for localization,","venue":null,"work_id":"d81a3eb7-e969-4eec-b45e-5cec1e95396d","year":2021},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.256832Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:903b1adb8f1fbfd595268f57d6d549977519bb9804c3accd5b59981df229fcb9","observation_id":"9e9a5f02-9040-4a22-96e3-4f73bf33597d","resolution":{"observed_at":"2026-08-05T10:15:51.149303Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.971974Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"4c374325-8464-4e43-a5b3-eff2c5d2ca39","year":2002},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.260812Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:2af7a68f53f0f7b23f38e0803ced7b8525e7becfb3649e3985df69ed6875eb28","observation_id":"378f623b-3cb7-441f-a5a5-92615f60a3f9","resolution":{"observed_at":"2026-08-05T10:15:50.976914Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.753349Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":"2e1f53c1-219a-4846-b8c8-0ebef5b74cf4","year":2004},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.265074Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:ddb62c0d089eca513bb5d2469bc0361c44bf8de7d861bae42b52daaf7f23c8f4","observation_id":"b842ae43-fce6-474b-98e0-49c11cde3333","resolution":{"observed_at":"2026-08-05T10:15:54.757754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.738812Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":"f136a6ee-7410-4bc8-a297-d6a0f314093e","year":2005},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.269256Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:7df5cfb162dd89b104b1f52c5a35332ec80a67665599f3f30cee815ffa31094b","observation_id":"53beb283-050a-423d-adf2-fb476ca875a0","resolution":{"observed_at":"2026-08-05T10:15:54.743961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.800482Z","title":"Cider: Consensus-based imagedescriptionevaluation,","venue":null,"work_id":"07628010-122c-4e41-9ac7-f2d6e5d55ab0","year":2015},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.273484Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:990ec248245f78d2d87948dd96148b5f31bdbf69ec126daa0cab75f0226b45f1","observation_id":"72945644-bc34-4efa-a7d8-9508602fe0ae","resolution":{"observed_at":"2026-08-05T10:15:50.804643Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.277593Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.277593Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:7e3a402a2943b38b4b29e1712929264ee559f70d4dd5d15147e0e801a8ad2324","observation_id":"04c925cf-71f6-484e-9e63-028be0ae81ef","resolution":{"observed_at":"2026-08-05T10:15:50.277593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.724941Z","title":"[Online]","venue":null,"work_id":"360590c1-16c8-4047-aba6-84ad15b8ec1e","year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.281787Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:4d0c3e2da3cb0b13be621913425e43dbe715e4f493989d3db9c832a2f200a0a6","observation_id":"d278ab02-5f3e-467d-8b7e-ffa54c9f4d57","resolution":{"observed_at":"2026-08-05T10:15:54.729336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T10:15:50.285815Z","title":"Qwen- VL: A versatile vision-language model for understanding, localization, textreading,andbeyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.285815Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:b8c5c3beac31a22f90139212f91cafd16b5fc4a838f0ad8cb57427754c76fde0","observation_id":"6a81dc45-306c-4d5a-9d07-c195f26cfae1","resolution":{"observed_at":"2026-08-05T10:15:50.285815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T10:15:50.290461Z","title":"Thellama3herdofmodels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.290461Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:3ded6ec8a39a2bca780f6f108d0e57645b5d4cfa500efdfe946b096476436b3b","observation_id":"0ac92598-d328-4961-9832-cf950c168724","resolution":{"observed_at":"2026-08-05T10:15:50.290461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:50.609941Z","title":"Improved Baselines with Visual InstructionTuning,","venue":null,"work_id":"905d6ad0-596c-404b-9c38-2d013aa3adb3","year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.294993Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:9b60db379443a0815a0800675e510cfee87f0b4b9f5b6d89ea09835da9773537","observation_id":"9302a986-4fef-4103-a691-a55c9e1c126c","resolution":{"observed_at":"2026-08-05T10:15:50.615011Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-05T10:15:50.299374Z","title":"mPLUG- Owl3: Towards Long Image-Sequence Understanding in Multi-Modal LargeLanguageModels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.299374Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:9a2f552892e255577593e38818ed8014365295247af0e3f88ca21b92652fe43b","observation_id":"0913bc48-a0bf-460e-a289-d19558f33f32","resolution":{"observed_at":"2026-08-05T10:15:50.299374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T10:15:50.303995Z","title":"Microsoftcococaptions:Datacollectionandevaluationserver,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.303995Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:8a15835a8ba94d3b7ada2e7a7c704c672b449ad1a48723d32c0352c20b679a7b","observation_id":"f9d83025-6180-41d2-896d-ad21f1ed39d8","resolution":{"observed_at":"2026-08-05T10:15:50.303995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:15:54.710397Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":"80f0e050-93b4-407e-a985-0d49d47b1a1e","year":2015},"citing_paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T10:15:50.308478Z"},"links":{"citing_paper":"/paper/2509.04378"},"observation_digest":"sha256:b91108d8d6c490c2bcf926d255209693e4c6460139956e4ca287a5c8c77f9f7a","observation_id":"6062d0bf-4da3-4113-84d4-ed2aef6d3676","resolution":{"observed_at":"2026-08-05T10:15:54.714965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04378","last_updated":"2025-09-09T08:09:40Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:43:13.149382Z","submitted_at":"2025-09-04T16:40:15Z","title":"Aesthetic Image Captioning with Saliency Enhanced MLLMs"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":14,"verified_exact":22,"verified_fuzzy":8},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2509.04378."}