{"as_of":"2026-08-14T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfe11869d87d0867009398f3b99626563b756b53dedfa42d3c0d94250badeea0","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:57:29.201224Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:24:57.169737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:36:05.014470Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"cited_work":{"arxiv_id":"2411.17794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17794","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nemo: Can multimodal llms identify attribute-modified objects?","venue":null,"work_id":"c28ad77b-8d18-4d23-952a-bb5085136634","year":2024},"citing_paper":{"arxiv_id":"2604.13313","last_updated":"2026-04-14T21:28:46Z","snapshot_observed_at":"2026-08-13T15:13:50.391868Z","submitted_at":"2026-04-14T21:28:46Z","title":"Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:57.169737Z"},"links":{"cited_paper":"/paper/2411.17794","citing_paper":"/paper/2604.13313"},"observation_digest":"sha256:fd8a40fdce12b5f21ab09999e5efdb33346969e82eec4a2babc08834a74513ad","observation_id":"12c5c272-28de-4f42-aea7-07925d6fb9d8","resolution":{"observed_at":"2026-05-11T10:36:05.021149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17794/citation-record","integrity":"/paper/2411.17794/integrity","json":"/paper/2411.17794/citation-record.json","paper":"/paper/2411.17794"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:30.007395Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"c0996794-882a-4fc3-94a4-73a5dcebb6e7","year":2022},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.007620Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c1e26c8fffbb85dc94d4e57bc237b61bfffed7dad2cd776573874f02d5b7e65f","observation_id":"9c1ff511-65d0-40df-b468-58e372740f50","resolution":{"observed_at":"2026-08-12T11:57:30.011651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T11:57:29.012130Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.012130Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:7c4ed4aa83e77642eaa451aab1b8636df8b039bc638a1419cd5057d498a7c84f","observation_id":"ebb4e11c-4f2b-4fb0-8171-5f3d23a204d6","resolution":{"observed_at":"2026-08-12T11:57:29.012130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.995116Z","title":"Breaking common sense: WHOOPS! A vision- and-language benchmark of synthetic and compositional im- ages","venue":null,"work_id":"83d7d952-1cac-4159-bb8a-65ba0451add3","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.016492Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:7dc0fa8d0e3379438449113e4300918a62759199c0e06c39b7d8442a0203390e","observation_id":"4d88c780-105f-482c-bf8a-810709dde470","resolution":{"observed_at":"2026-08-12T11:57:29.999362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19474","last_updated":"2024-11-25T12:53:44Z","snapshot_observed_at":"2026-08-12T23:13:26.513193Z","submitted_at":"2024-07-28T11:56:03Z","title":"Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19474","snapshot_observed_at":"2026-08-12T11:57:29.020551Z","title":"Visual riddles: A common- sense and world knowledge challenge for large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.020551Z"},"links":{"cited_paper":"/paper/2407.19474","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2ffd1eeba396cef234162b47b62a971684efe90f3371e47929e98b989b2b6837","observation_id":"28130577-7c02-4337-8cc3-d06c740ee696","resolution":{"observed_at":"2026-08-12T11:57:29.020551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-12T11:57:29.024930Z","title":"InternLM2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.024930Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:09a136627b4eac16b0db7f1e3254efdaac00651516bbeecbe96b2310fedf33e3","observation_id":"35c01332-1ba4-4faf-9734-98138069ce28","resolution":{"observed_at":"2026-08-12T11:57:29.024930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-12T11:57:29.029279Z","title":"MiniGPT-v2: Large language model as a unified inter- face for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.029279Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ffc59dcdb4fdedfd6794642b5fc54ee149672bf9f2aeb0e9e758c70ab9ced7f7","observation_id":"1c78c158-3ead-4c2d-bc7a-a01149fe323d","resolution":{"observed_at":"2026-08-12T11:57:29.029279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T11:57:29.033836Z","title":"How far are we to GPT-4V? Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.033836Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:4895d97728cb91543579a1ee751e7c85ac4532a71db8238205898e09174975ee","observation_id":"1919acb8-38ab-48f9-abdf-90f621f7af2a","resolution":{"observed_at":"2026-08-12T11:57:29.033836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.982873Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"309f40b7-5bc2-4c0d-adb2-9aa5560c48bc","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.038639Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:b323fdc231c4eb0065a2ee03e6ffe1706b7f1eeeddb92ebde7d0a437951e0699","observation_id":"00deef47-f46a-4d61-862a-2d659f2a2e3d","resolution":{"observed_at":"2026-08-12T11:57:29.986905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.970648Z","title":"InstructBLIP: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"11e8cc84-577a-41d5-89b7-863c19c4f882","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.042409Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:8ace79dc5e28de24fa2cdcb8e0b6c561447e38e92c81925de84d06ba27c4678b","observation_id":"ffb52276-4dbf-42a5-a8a7-6188c612ccf3","resolution":{"observed_at":"2026-08-12T11:57:29.974761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.957513Z","title":"ImageNet: A large-scale hierarchical im- age database","venue":null,"work_id":"f4978810-9845-4c00-ba8c-b0a893d0b345","year":2009},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.046295Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:5b9767ad0da9e1063e4262106f9cfc19821ebc6f2dad2ac20000111ee00382e8","observation_id":"74bc106e-3051-457d-bd6b-6fdf84bf9da0","resolution":{"observed_at":"2026-08-12T11:57:29.962422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.944736Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":"74823d86-8597-4a40-ade7-d1a65a1f4681","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.049953Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:49d028ad2fc9faebef1c96cf071e1a585abd1e28b5c6fc3dae62a63345738e09","observation_id":"acce52c3-5ad4-4f5d-ab4d-d6ec5a633617","resolution":{"observed_at":"2026-08-12T11:57:29.948764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.932482Z","title":"EV A: Exploring the limits of masked visual represen- tation learning at scale","venue":null,"work_id":"ca6466d8-0245-4a10-a275-65cb0e48d431","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.053556Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2873e935d15f1ac4c8495e977959590900ac651d8328549fb25bda4d6e20fdad","observation_id":"6958ca54-6c05-485d-bb6d-d0752481924a","resolution":{"observed_at":"2026-08-12T11:57:29.936580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T11:57:29.057433Z","title":"MME: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.057433Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:31b46838b3377cb7336d41a7c97b49d149c0442e19e587465d6f8604f268acee","observation_id":"f028fc6e-4b57-478f-87fb-90e4505b9d39","resolution":{"observed_at":"2026-08-12T11:57:29.057433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.920328Z","title":"Gemini., 2023","venue":null,"work_id":"feb853a7-6fd9-4e47-8c74-db6f798c86e1","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.061609Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c706154ed1da9d790029900ec7153d1e4064dbea2403877529a75d9c277f1b76","observation_id":"8e81c1a8-f204-4538-aa07-3588ac598431","resolution":{"observed_at":"2026-08-12T11:57:29.924269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.907915Z","title":"Hal- lusionBench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":"c7619652-e1ca-4ccd-af92-b665e83d069e","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.065609Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2bcb6692301b54ac4d053c00f88dd60405c905265c0b457cc28616acd2c0e216","observation_id":"6413d14b-cc83-41c8-b741-b53012ff8f07","resolution":{"observed_at":"2026-08-12T11:57:29.912168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-13T05:15:43.956937Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-12T11:57:29.069305Z","title":"SEED-Bench-2: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.069305Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:1facdbbbaf0dc6ddadc34669a94a1f0ede4665b43aec951256594c5f21370c9f","observation_id":"3c0226eb-72d7-4783-b93b-32da6202be57","resolution":{"observed_at":"2026-08-12T11:57:29.069305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.894099Z","title":"SEED-Bench: Benchmarking multimodal large language models","venue":null,"work_id":"5cb190a0-75b7-4852-af07-8f949fb430b4","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.073147Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:19c8b5bbbd3507de0b65ba11b5d8acc6b80cea1a9013049e35e2b84108d6e374","observation_id":"bf354ab2-46c2-4c6d-bda0-fce9785b7fb3","resolution":{"observed_at":"2026-08-12T11:57:29.898939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.881924Z","title":"Naturalbench: Eval- uating vision-language models on natural adversarial sam- ples","venue":null,"work_id":"4b879658-a946-40a9-af50-32f245a43347","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.076856Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:41451780bad5ba00b7cd4a4bbaf4d09314ef0e500c40c5f4b835fbddd2248940","observation_id":"9e0f7929-dcc2-4b94-94b7-2719b23accc1","resolution":{"observed_at":"2026-08-12T11:57:29.885960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.869877Z","title":"LLaV A-NeXT: Stronger LLMs supercharge multimodal capabilities in the wild, 2024","venue":null,"work_id":"8817f676-94a0-41c6-bcdc-70861f90bc94","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.080548Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:be2baff92648a8efa39fb2e8bb76d57b2a03a7740af0b564aab1e75561199cdb","observation_id":"ff023b8e-d03c-49d6-b83c-0884b3184ae7","resolution":{"observed_at":"2026-08-12T11:57:29.873904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.856476Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"d65b4457-bdcb-4d07-adbf-5fb88fd2ba4f","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.084349Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:b95e4c385f96229397309d7a2c960fef975e47d110248585904492f0fc14eed5","observation_id":"46ab11c0-667f-421e-85ff-310e912d9999","resolution":{"observed_at":"2026-08-12T11:57:29.861617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.843909Z","title":"FoodieQA: A multimodal dataset for fine-grained understanding of chinese food culture","venue":null,"work_id":"64dfc797-6929-4bb3-867a-0f1311a6bdc9","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.088284Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:5f2cbf8ddf48081dfe771e0510de410ea55ddc267562e388b8ce9ad5ebea26c5","observation_id":"8171e875-5c42-4ad9-b087-14455198dcc0","resolution":{"observed_at":"2026-08-12T11:57:29.848224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.734059Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"7aede258-c7ac-4628-a540-398adb10e3ea","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.092028Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:a68f3e77480fd85c7b5563254c2a4200f1181714eff61b78938534826e5f5f71","observation_id":"e336f4b7-b409-40ee-b9c5-38effed72c9f","resolution":{"observed_at":"2026-08-12T11:57:29.834662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.721469Z","title":"Visual instruction tuning","venue":null,"work_id":"36246054-0df1-45be-8f7f-100c0809b900","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.096069Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:3a90e9c2997be41b567838f727e265cdfa70e6ec453f8702d27ab97c33251e8a","observation_id":"aa38c0a9-84f6-4197-82be-97650e95f758","resolution":{"observed_at":"2026-08-12T11:57:29.725556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.707880Z","title":"MMBench: Is your multi-modal model an all-around player? In Proc","venue":null,"work_id":"0f54020b-47e8-4173-8704-1c7690474367","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.099764Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:a8475db7f7e7d0b293a956e0a2a12fcf143b4dcf1a604b7d17d4e8e385116ca4","observation_id":"fcbe0d19-002d-48d1-b745-40cae90a2cd5","resolution":{"observed_at":"2026-08-12T11:57:29.712165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.695383Z","title":"From here to human-level AI","venue":null,"work_id":"267ea76a-b0b4-4194-9e94-791f0d29f73d","year":2007},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.104119Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:d2a78700e57e32117ee2b6b9843cdb83ea2a0b960bf76199120ed9f23844afe9","observation_id":"f3b36e6e-ba15-4cde-b70b-14c99e052a24","resolution":{"observed_at":"2026-08-12T11:57:29.699235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20331","last_updated":"2025-06-09T11:51:00Z","snapshot_observed_at":"2026-08-13T00:41:52.316492Z","submitted_at":"2024-03-29T17:59:53Z","title":"Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20331","snapshot_observed_at":"2026-08-12T11:57:29.107976Z","title":"Unsolvable problem detection: Eval- uating trustworthiness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.107976Z"},"links":{"cited_paper":"/paper/2403.20331","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ec1d72d2d6e8886a8985cb978e640b62b99973ed97f3a1b0f3dacf7d1a3a5a74","observation_id":"1a8c0e8a-bdf5-41f1-a0cf-5c0bd195d76b","resolution":{"observed_at":"2026-08-12T11:57:29.107976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.683435Z","title":"Position: Levels of AGI for operationalizing progress on the path to AGI","venue":null,"work_id":"70f8b662-85b3-43c6-b737-1455306f0ffe","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.112023Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:bc0791aff0935e4c343bb0dac9d786ec4ec61016c5bc1aa8cab72beae844c20c","observation_id":"c49d540f-1f35-4ffc-9263-f5213194d74c","resolution":{"observed_at":"2026-08-12T11:57:29.687401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.671513Z","title":"GPT-4o, 2024","venue":null,"work_id":"2c74d1c1-5354-444d-a498-b2ac0b870831","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.115794Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:3e73e5e3259dc5482f99f7c79a0f11170e11cf2e2cfb05af6d82de5500b4642f","observation_id":"ffeb8b1c-da57-40a3-b4ff-3d21227f552e","resolution":{"observed_at":"2026-08-12T11:57:29.675430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.658900Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"b6a2d7d2-b80d-4a16-8649-054939fd7b80","year":2021},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.119566Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:9f31ac5fd0bbbb3f724a378409226118c11bae9fab32a08684229ca6d4e4f1dc","observation_id":"b80c38a8-aee4-464f-a679-dbe8ac3a27d2","resolution":{"observed_at":"2026-08-12T11:57:29.663227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.646630Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"398082c7-63ba-4557-b7d7-621d41c684a2","year":2021},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.123316Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:77b7598f771054eac15ab7cef73ba112ca725c4390c19ca0dcbb3bb31d2d9d39","observation_id":"47900640-6151-4743-9d30-7e73eb74b853","resolution":{"observed_at":"2026-08-12T11:57:29.650633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-12T11:57:29.127230Z","title":"EV A-CLIP: Improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.127230Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:afe5efdebc0eefde0e5bb76bc542508eec5e284e1d59d6a2e9359bb5fe840d13","observation_id":"2ecd108c-8b53-46b6-bdcb-7417fe87ef9e","resolution":{"observed_at":"2026-08-12T11:57:29.127230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.634115Z","title":"Link- context learning for multimodal LLMs","venue":null,"work_id":"d0068b8f-49c1-4af5-add5-704a49d42e57","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.131172Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2c6c7cd487328cf9f6328bfb69505c2d0b78fcd9f6702aed686e4c39907766ac","observation_id":"ed030b23-9307-49ba-a19a-715009b5ff27","resolution":{"observed_at":"2026-08-12T11:57:29.638505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.622010Z","title":"Label Studio: Data labeling soft- ware, 2020-2022","venue":null,"work_id":"7d01256d-4ec4-45af-9cc0-d26aa6884f9a","year":2020},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.134990Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:c67f49296eb78f1e7ab263f8dd49f6b9e4428319da99d961494350876b17a87f","observation_id":"aace756d-93a0-47ea-b5ba-7a43b3f73cb4","resolution":{"observed_at":"2026-08-12T11:57:29.625949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.609032Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal LLMs","venue":null,"work_id":"ee6b54a9-8557-4eac-9f50-465d3f71dbea","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.138719Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:ea272bce0e728fe7bee9a0f86685da3097dafcd9dc93bf8c6eb8600d50fba74e","observation_id":"79b3aa1f-b5ff-434c-9691-f332dc9bf7d9","resolution":{"observed_at":"2026-08-12T11:57:29.613670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.596426Z","title":"Eyes wide shut? Exploring the vi- sual shortcomings of multimodal LLMs","venue":null,"work_id":"5a7d129d-7962-4a53-af74-b3deddf126e9","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.142487Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:40b56f3dbe0e970c50e45e8f659ecd44208100abf0597ac1ab2e6196c7ebe01a","observation_id":"c7dc8d40-bde3-44b3-b14b-90fd04aab1b4","resolution":{"observed_at":"2026-08-12T11:57:29.600539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T11:57:29.146242Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.146242Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:f54cc340950b8de8b027a1893140c8a77fa8781d7e6f154c97ef4f9796577b16","observation_id":"a603c976-d34d-4b55-9bf0-0b714c5c1afc","resolution":{"observed_at":"2026-08-12T11:57:29.146242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.583941Z","title":"Recent advancements in fruit detection and classifica- tion using deep learning techniques","venue":null,"work_id":"8dfb9abe-ca05-4748-a81c-8d53a469cc21","year":2022},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.150418Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:00c47321c709fee173fb180fb24dd8f14b37c7bd7f983e556fcb9e1fd9a0129c","observation_id":"a914c956-324d-478b-ac7e-0e1a1f32ba7d","resolution":{"observed_at":"2026-08-12T11:57:29.588119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.571672Z","title":"Le, Thang Luong, and Golnaz Ghiasi","venue":null,"work_id":"9e5405fd-14de-4e31-8ee9-8882cefcf089","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.154142Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:2b57b08ee7684d041b756068874b7d0f035411ce06aabf0bba1e487bd63884bb","observation_id":"b55d1ac3-ea59-4cc8-94fb-06298f4b59f8","resolution":{"observed_at":"2026-08-12T11:57:29.575746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.158345Z","title":"xGen- MM (formerly BLIP-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.158345Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:9dca61964e6a8d19eea594acf221452462e12dcea8ef3df2e50bc4c6a5c7571f","observation_id":"faa5d3f1-5b31-417b-95bf-b4231f2d58ca","resolution":{"observed_at":"2026-08-12T11:57:29.158345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T11:57:29.162061Z","title":"mPLUG-Owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.162061Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:bddc2df0ef9c799627bd0e609ed2b8e416d49d350ffc8aac803b36d94721108c","observation_id":"1bf36864-c24d-45ee-b855-05555cb4c46b","resolution":{"observed_at":"2026-08-12T11:57:29.162061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-12T11:57:29.166131Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.166131Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:bde5333e48b3ed8840b09031e13e4ca80386733eb1e259d9a58b613b4d03a59a","observation_id":"5a9af856-ff51-4cec-a2a9-398e3f64cbae","resolution":{"observed_at":"2026-08-12T11:57:29.166131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.558435Z","title":"MMMU: A massive multi-discipline multimodal un- derstanding and reasoning benchmark for Expert AGI","venue":null,"work_id":"6820ba95-50bd-4346-8a09-b7745d6773ec","year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.170068Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:521302739432c2f94e1ffeec151ff960cb3c903ba4939508e754f1e834002071","observation_id":"74f2d605-937b-4203-a357-141d63b74a09","resolution":{"observed_at":"2026-08-12T11:57:29.562615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-12T11:57:29.173837Z","title":"MMMU-Pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.173837Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:53fcf0f94e3d9a8cadf093790eed3c681a6e4779f354c66b73e8847625f1da44","observation_id":"81cedbb2-41d0-4939-9e2c-3a3ce387579c","resolution":{"observed_at":"2026-08-12T11:57:29.173837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.544746Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cccc4a60-23fb-4211-a099-86e1da3dd31a","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.177834Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:46e778ac8633320c5f5c65cf33243e10f857098253be3572691221848a7bc2f6","observation_id":"b8aa4ff3-da1c-4cf7-81b8-027479da32d1","resolution":{"observed_at":"2026-08-12T11:57:29.549109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09346","last_updated":"2024-12-28T07:32:00Z","snapshot_observed_at":"2026-08-13T00:54:20.652838Z","submitted_at":"2024-03-14T12:51:07Z","title":"B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09346","snapshot_observed_at":"2026-08-12T11:57:29.181590Z","title":"A VIBench: To- wards evaluating the robustness of large vision-language model on adversarial visual-instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.181590Z"},"links":{"cited_paper":"/paper/2403.09346","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:60ae99c0454f6f233db9e079aa92f0145ae2540e610e412934fe126a90ad7123","observation_id":"cadb536a-be2d-4ff9-b053-f671129816ee","resolution":{"observed_at":"2026-08-12T11:57:29.181590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-12T11:57:29.185644Z","title":"InternLM-XComposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.185644Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:fdb060a1a3820463f8a6472df853cf61afdc4c65a17019ea080b6fc4d66118d2","observation_id":"aad8ed8e-a71d-4e96-8c3e-28895f934dcc","resolution":{"observed_at":"2026-08-12T11:57:29.185644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.531789Z","title":"On evaluating ad- versarial robustness of large vision-language models","venue":null,"work_id":"4a3a6654-3b4f-4ae7-b584-58936ea50328","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.189782Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:3ef315b6abb465d39031fcb4deaeea4d4f54073b64afcae555f5794e3165641f","observation_id":"2e0c93ba-4e6b-4e1c-ba84-fb4350a2a774","resolution":{"observed_at":"2026-08-12T11:57:29.536158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.519100Z","title":"ROME: Evaluating pre-trained vision-language models on reasoning beyond visual common sense","venue":null,"work_id":"b80e42b4-d4ce-44a7-9601-91bf48962e81","year":2023},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.193661Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:77f49afe297c74e43456197ce56399ce43f3e7c97fba25a682e02b7fbbca9e2e","observation_id":"c3dfd032-6ed0-46f1-8e59-f7b0b56f4b73","resolution":{"observed_at":"2026-08-12T11:57:29.523316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.505637Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"22684681-4842-4f2c-9618-90e05627f08c","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.197392Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:a7d52fedc7c8d59f6855de12e616aeef8a61f19037c7626bbb76b3a62e7a1688","observation_id":"84c5baff-60b7-4802-a6df-9bcfe455bf38","resolution":{"observed_at":"2026-08-12T11:57:29.510486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:57:29.491639Z","title":"dall-e-3","venue":null,"work_id":"91f1fad6-e3f7-4022-9da3-0fb0ee33d7fe","year":null},"citing_paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:29.201224Z"},"links":{"citing_paper":"/paper/2411.17794"},"observation_digest":"sha256:d877df8b9e4911ffe5ad884e2d8774ab3d63639b68ddc37df0202549fa94c55a","observation_id":"7053f530-aa0c-49e2-b1da-d1771aef3df6","resolution":{"observed_at":"2026-08-12T11:57:29.496650Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17794","last_updated":"2024-11-26T17:47:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:33:24.839255Z","submitted_at":"2024-11-26T17:47:34Z","title":"NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2411.17794."}