{"as_of":"2026-08-24T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:102c392883f627c5cbc19369ddf667196a8b4719230f4332b3d8e64dd1e12edc","coverage":[{"denominator":158,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:36:09.424513Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T23:20:01.094730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T23:21:21.327759Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"cited_work":{"arxiv_id":"2412.04531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magebench: Bridging large multimodal models to agents","venue":null,"work_id":"cdc08a2a-600d-49b1-8ec6-6093a20f07b5","year":2024},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-08-18T16:51:32.000170Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2412.04531","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:e3f3a802472a507d58df72942872f0e7fd7fe5e96569121eb3fa62d3fb6fdcc7","observation_id":"9c172641-d4e1-47f8-9e53-b03f9e409b3f","resolution":{"observed_at":"2026-05-16T15:15:46.355848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"cited_work":{"arxiv_id":"2412.04531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magebench: Bridging large multimodal models to agents","venue":null,"work_id":"cdc08a2a-600d-49b1-8ec6-6093a20f07b5","year":2024},"citing_paper":{"arxiv_id":"2512.10605","last_updated":"2026-04-15T12:14:26Z","snapshot_observed_at":"2026-08-14T22:47:44.286220Z","submitted_at":"2025-12-11T12:58:36Z","title":"LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T23:20:01.094730Z"},"links":{"cited_paper":"/paper/2412.04531","citing_paper":"/paper/2512.10605"},"observation_digest":"sha256:6c4599bba842b84bfcab1c048c6d95dfff879deb072d5254b0c595e834254b20","observation_id":"ba845c56-06b6-4390-8b63-95c6ee186084","resolution":{"observed_at":"2026-05-16T23:21:21.330732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04531/citation-record","integrity":"/paper/2412.04531/integrity","json":"/paper/2412.04531/citation-record.json","paper":"/paper/2412.04531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.961145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.961145Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a44419f37f5f41ae92e1b032a32a13092a78ebcef2ed036669e35b79a04cb559","observation_id":"40456118-d064-4593-b5d3-ab873dba978a","resolution":{"observed_at":"2026-08-11T21:36:08.961145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.966044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.966044Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:7adac1d5b6ed92521489da56fa457ee4505c3adac356abeb44d0541f077ebe73","observation_id":"97901410-a563-4c21-b18e-35c298c9e870","resolution":{"observed_at":"2026-08-11T21:36:08.966044Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.970373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.970373Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c91bf66c7d7d3c026881ad99aa07699ce60e3ab196d3d375c3b231383ba8a9cd","observation_id":"902f6efe-dab9-4eb1-a34f-d9e3ad83d9b2","resolution":{"observed_at":"2026-08-11T21:36:08.970373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.974839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.974839Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:b33b8d829b05dcccbc84c5d1ef7d6e3471b7e57e0be6b9e4957251f88bd00f0d","observation_id":"e1d66722-2686-425f-a0db-677b3b1169cd","resolution":{"observed_at":"2026-08-11T21:36:08.974839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T21:36:08.979514Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.979514Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:10e306ac212e1b8f3c6039501346f13ed8727c21f38fa77de4ee3bf3b584cf09","observation_id":"902e6b67-c71c-41af-ae4c-505c2a57d8a5","resolution":{"observed_at":"2026-08-11T21:36:08.979514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T21:36:08.984727Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.984727Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:354271fc38612e6315528e4cadc9eb94143d27aaba7543d5076b3d19934caddd","observation_id":"cea70a80-6be0-4e24-aa4b-54373ef680ab","resolution":{"observed_at":"2026-08-11T21:36:08.984727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.990262Z","title":"Few- shot training llms for project-specific code- summarization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.990262Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:1c26ceb08b1686e4d8b823aad3dc310b6b5976c6cf1c7746fa72c3bf4ea28e44","observation_id":"005d2eda-234a-44a0-a2a9-44d1bd53ef27","resolution":{"observed_at":"2026-08-11T21:36:08.990262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.994857Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.994857Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a1d9e6d96c0dc5b955db003db0da8f125d4e886efab6b2ab80f8bfb024cf5a4a","observation_id":"1a3d79e5-6ee6-4ce5-860a-b4752cdf010e","resolution":{"observed_at":"2026-08-11T21:36:08.994857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:08.999604Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:08.999604Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a86aff35b129dff9e04e7ae5b3e2909746ab0f1e7025c095cf4a2f0c843363c8","observation_id":"9091295d-0d1d-4ece-94ba-247f0f58667a","resolution":{"observed_at":"2026-08-11T21:36:08.999604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-23T14:57:41.737165Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-11T21:36:09.004778Z","title":"Chateval: Towards better llm-based evalu- ators through multi-agent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.004778Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:2d11a19df878bc825f18b1055be0924a4f18a1879963d9fa422454bea9275821","observation_id":"bce4e702-2e47-4f6c-bb89-2be41fab4c2f","resolution":{"observed_at":"2026-08-11T21:36:09.004778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.010615Z","title":"Q-ground: Image qual- ity grounding with large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.010615Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:fcb84bf927160cac35e751b3e3e581a5f480a300ffc16f3c93e49cdafa025953","observation_id":"5c0e8103-feac-462d-aead-ccfe03d157fb","resolution":{"observed_at":"2026-08-11T21:36:09.010615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12889","last_updated":"2024-09-22T09:51:58Z","snapshot_observed_at":"2026-08-19T02:18:21.840801Z","submitted_at":"2024-09-19T16:30:25Z","title":"Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12889","snapshot_observed_at":"2026-08-11T21:36:09.015223Z","title":"Can vlms play action role-playing games? take black myth wukong as a study case","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.015223Z"},"links":{"cited_paper":"/paper/2409.12889","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:5f137b69c85d15d8ddc0dfbffd6da767f71ea7d11b208ae55712c030e99979cb","observation_id":"9e5d83fe-ecea-42f5-ad0f-69a49855b123","resolution":{"observed_at":"2026-08-11T21:36:09.015223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.020036Z","title":"Internvl: Scaling up vision founda- tion models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.020036Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c617bae25c04b4c85028277499824f74bf819f6bf2de9191216364f17b128664","observation_id":"fe679658-6798-414e-8add-13e20a0eb35d","resolution":{"observed_at":"2026-08-11T21:36:09.020036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.024766Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.024766Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a7a05bf9c7a4a987927b9280b9bc3390449229d78d7d5662ee90d0adad876109","observation_id":"6d1f2977-25f3-49e6-b19a-f42d4af55cd0","resolution":{"observed_at":"2026-08-11T21:36:09.024766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-19T13:25:25.058603Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-11T21:36:09.029864Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.029864Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:2a3f3d9e6cb7543694196572704412437adba359f72f75dafd157865bcef2cb4","observation_id":"4bd26a9b-63a2-4fb6-b15a-87b4279f65bf","resolution":{"observed_at":"2026-08-11T21:36:09.029864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00993","last_updated":"2024-07-01T06:10:01Z","snapshot_observed_at":"2026-08-16T13:38:15.680050Z","submitted_at":"2024-07-01T06:10:01Z","title":"Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00993","snapshot_observed_at":"2026-08-11T21:36:09.035083Z","title":"Mobile- bench: An evaluation benchmark for llm-based mo- bile agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.035083Z"},"links":{"cited_paper":"/paper/2407.00993","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c38d5d14c65b4ea830d3b980d82875a7e4fbc14652cb87171ed9ca36a6022c9c","observation_id":"4f8b613a-27ec-4f33-9737-9797d26c6605","resolution":{"observed_at":"2026-08-11T21:36:09.035083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.040150Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.040150Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:466a3105b78c59a436b44526b7daa063edaee4c50427fc03b9a2be2eb0a85ee9","observation_id":"633acbdb-57ae-4717-b15c-eca4f6993f37","resolution":{"observed_at":"2026-08-11T21:36:09.040150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.044747Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.044747Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:111a100aef25d356ce2d1d090fda27b9d7cb2b99568e68adaa237e401101a721","observation_id":"5fd9bf3b-a67c-4606-8b2d-d8252081d00e","resolution":{"observed_at":"2026-08-11T21:36:09.044747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T21:36:09.049827Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.049827Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:bf26746337917c169dc7547a32995bd5eeb5e143094711fa1f67edbfde193d67","observation_id":"d4253818-9249-49b7-88b4-3e366a6d9ce8","resolution":{"observed_at":"2026-08-11T21:36:09.049827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10313","last_updated":"2024-11-24T18:44:27Z","snapshot_observed_at":"2026-08-19T17:30:11.022269Z","submitted_at":"2024-05-16T17:59:02Z","title":"How Far Are We From AGI: Are LLMs All We Need?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10313","snapshot_observed_at":"2026-08-11T21:36:09.054368Z","title":"How far are we from agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.054368Z"},"links":{"cited_paper":"/paper/2405.10313","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:29fe682fd113d417828515eb60e92f699009eeac43539cb033d1644088a8313f","observation_id":"08ea16b2-5219-45f0-a256-1985a1867276","resolution":{"observed_at":"2026-08-11T21:36:09.054368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-20T02:50:01.167264Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T21:36:09.059138Z","title":"Blink: Multi- modal large language models can see but not per- ceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.059138Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:6916ce5801e2ead58eab12d64468a3806c426494cf027cdadf56edc97114fc4d","observation_id":"7921fe95-972e-483f-b52d-a833ce1a2b35","resolution":{"observed_at":"2026-08-11T21:36:09.059138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-08-20T15:02:05.036917Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-08-11T21:36:09.063893Z","title":"Multimodal web navigation with instruction-finetuned foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.063893Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:4fe5d4bab03fa9a96319af1bc0f697146f7f4158078d2c2d73d111e5e86454b4","observation_id":"96d6fedc-cc6c-4400-bab2-5df327626722","resolution":{"observed_at":"2026-08-11T21:36:09.063893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.068767Z","title":"Cantor: Inspiring multimodal chain-of-thought of mllm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.068767Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:9ff9c9243cc0ac61d8231e46d902301d24bb4a7b2f0c53e1ad11aede8bd88da8","observation_id":"a565a4a8-a75b-4c09-99e6-70d5c01339f7","resolution":{"observed_at":"2026-08-11T21:36:09.068767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.073113Z","title":"Formalizing properties of agents","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.073113Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:324417e5cefbd1fbadb9771802dfa233c2adc545bf54bff5dc7fca95a07a59c3","observation_id":"48f79f57-fc5d-4c95-bee6-7ce99cbf3a0d","resolution":{"observed_at":"2026-08-11T21:36:09.073113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.077498Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.077498Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:3c8d0ae562fc619b1c167bdfce592ac06d3dcf578bd87c5957a329b7dfa9830d","observation_id":"10e642a6-db10-4a42-865b-dad654e9a8cc","resolution":{"observed_at":"2026-08-11T21:36:09.077498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-21T21:57:22.892249Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-11T21:36:09.081789Z","title":"Large language model based 9 multi-agents: A survey of progress and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.081789Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:98a419799fbebf977c055fb9c4960081f36939f9feb851c7dbaa1a436a370fa8","observation_id":"81e486d0-0a6c-42dc-8800-a609c8ea691c","resolution":{"observed_at":"2026-08-11T21:36:09.081789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12998","last_updated":"2023-04-24T08:29:14Z","snapshot_observed_at":"2026-08-20T06:23:21.679224Z","submitted_at":"2023-04-24T08:29:14Z","title":"ChatLLM Network: More brains, More intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12998","snapshot_observed_at":"2026-08-11T21:36:09.086409Z","title":"Chatllm network: More brains, more intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.086409Z"},"links":{"cited_paper":"/paper/2304.12998","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:ce6f09e61cae13f04032cf239ed7069ec25b17a44be620ba3b28d8b53c01c835","observation_id":"4f77febb-9195-413d-9e61-7c229870d8d3","resolution":{"observed_at":"2026-08-11T21:36:09.086409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.090563Z","title":"Sapien: affective virtual agents pow- ered by large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.090563Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:061eec0a6724b069641ec5754c2862969f1d375201b092e84439495f7594ee99","observation_id":"e702223a-ed6e-42bf-a9e9-aa96e5930330","resolution":{"observed_at":"2026-08-11T21:36:09.090563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-11T21:36:09.094459Z","title":"Olympiadbench: A challenging bench- mark for promoting agi with olympiad-level bilin- gual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.094459Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:1d7b0ebdbf218154761d991229a3fb1a4eb7ec6dcd1f11514d7500f9bff7d88a","observation_id":"d0842d35-d8e4-47a3-a992-f390f8b0ff1a","resolution":{"observed_at":"2026-08-11T21:36:09.094459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-08-12T16:02:21.969968Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00352","snapshot_observed_at":"2026-08-11T21:36:09.098831Z","title":"Metagpt: Meta program- ming for multi-agent collaborative framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.098831Z"},"links":{"cited_paper":"/paper/2308.00352","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:f3f30bc2ec896dcf563d8a9df0524466a13f81fd9341b6cb6b0a5b0d5d0ce88f","observation_id":"dd7a9de0-fd77-42df-9268-83dbc0e70f59","resolution":{"observed_at":"2026-08-11T21:36:09.098831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-20T00:31:41.370968Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-11T21:36:09.103146Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.103146Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:750042ce8a5196a736b7dab5ebd112f2036ce92fab87c95c9e649a02ad6845e2","observation_id":"e4b8eed5-48df-4373-873a-7fe68babdda0","resolution":{"observed_at":"2026-08-11T21:36:09.103146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-11T21:36:09.107791Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.107791Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c9408c00df91d82204b3e420a6e10ff8d3d65f9345bd90a7bf4a672a508fd0a7","observation_id":"67ee2fa6-f894-47e4-b932-b6e5549c10b2","resolution":{"observed_at":"2026-08-11T21:36:09.107791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.112585Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.112585Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a9ddb5a3925b7b8d8e753e542bc6c36728cee6a08cc0121b6eaa341c87d69726","observation_id":"327fafea-72df-4157-ad40-296f00e54f14","resolution":{"observed_at":"2026-08-11T21:36:09.112585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-08-17T09:28:37.052265Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-08-11T21:36:09.116911Z","title":"Tablevqa-bench: A visual question answering bench- mark on multiple table domains","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.116911Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:9adb57c8fd12ea409828beda75a13e97a4379a12376892927dc0ca7485ba367e","observation_id":"4bab5268-be5d-429b-803a-7f47669020ae","resolution":{"observed_at":"2026-08-11T21:36:09.116911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.121635Z","title":"Large lan- guage models are zero-shot reasoners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.121635Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:8c8faa50d2dafa269de2fc30b1960b4f30a2c57588d249dc4a287fcc9cd88ab8","observation_id":"fa5cf90d-bce3-44ec-9a94-c1160a187e45","resolution":{"observed_at":"2026-08-11T21:36:09.121635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.126287Z","title":"Google re- search football: A novel reinforcement learning en- vironment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.126287Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:24118aee632376969aabf13b32cbef002e7215520ecdc9d81c72b9b8363cd562","observation_id":"b730a4c6-e814-419b-9b2b-13321c3e62f0","resolution":{"observed_at":"2026-08-11T21:36:09.126287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.130786Z","title":"Learning the user’s deeper preferences for multi-modal recommendation systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.130786Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a584b8dee8701a782e93768cb1f06a5f1cd07e770d2528da05f052116a137cba","observation_id":"73578bc7-8659-4232-b307-3668ec28137c","resolution":{"observed_at":"2026-08-11T21:36:09.130786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.135407Z","title":"Seed- bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.135407Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:441b4c92d854911696826a02661f5a02788ac97dcc4c88153803dec60e1aa77f","observation_id":"deb0d743-c846-44d6-a3de-7eae714c4d94","resolution":{"observed_at":"2026-08-11T21:36:09.135407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.140554Z","title":"Camel: Commu- nicative agents for\" mind\" exploration of large lan- guage model society","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.140554Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e73cca7266e1ce5ccc20d98ce586729b143247c2c9dd9f7a61e4ebff40b1687a","observation_id":"d22346d8-ad10-4c5d-99ad-ef32bada2684","resolution":{"observed_at":"2026-08-11T21:36:09.140554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19693","last_updated":"2024-06-28T07:09:06Z","snapshot_observed_at":"2026-08-18T22:52:08.215093Z","submitted_at":"2024-06-28T07:09:06Z","title":"MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19693","snapshot_observed_at":"2026-08-11T21:36:09.145274Z","title":"Mmro: Are multimodal llms eligible as the brain for in-home robotics? arXiv preprint arXiv:2406.19693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.145274Z"},"links":{"cited_paper":"/paper/2406.19693","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:2a5b4e6a0a9e86086489fe02de84a4d99a5beada6be6eebf8095e31fb1cc734e","observation_id":"316034b2-5d76-4439-a7fe-c5e8468987d4","resolution":{"observed_at":"2026-08-11T21:36:09.145274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.150148Z","title":"Ap- pagent v2: Advanced agent for flexible mobile inter- actions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.150148Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:23ed8ee7faca46dbde777108c2ec7f62c65321aeb8f6cd690679a10d971f2db5","observation_id":"e80899af-0633-4570-9005-b185d676b7ea","resolution":{"observed_at":"2026-08-11T21:36:09.150148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08367","last_updated":"2025-06-03T02:30:05Z","snapshot_observed_at":"2026-08-21T10:50:32.715497Z","submitted_at":"2023-10-12T14:38:25Z","title":"MCU: An Evaluation Framework for Open-Ended Game Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08367","snapshot_observed_at":"2026-08-11T21:36:09.154856Z","title":"Mcu: A task-centric framework for open- ended agent evaluation in minecraft","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.154856Z"},"links":{"cited_paper":"/paper/2310.08367","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:835df6710823973556cf241de61c918ad1aebaee570193e403038605f268c931","observation_id":"7f337c62-d729-47d3-bc42-0c42ad7653aa","resolution":{"observed_at":"2026-08-11T21:36:09.154856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.159517Z","title":"Visual spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.159517Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:52ff6e5afe45e80858171e2ea5a7a289b79139e8e21c2fc4ba14f10cfb02d3ef","observation_id":"a9a4a946-812b-4f44-9c06-f4ff7272d754","resolution":{"observed_at":"2026-08-11T21:36:09.159517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.164077Z","title":"Improved baselines with visual instruction tun- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.164077Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e4e1d1d29bde207142ac75c5b6168c98fbcc65cecb3af595876008e2f0015255","observation_id":"7999d476-e67e-483f-8244-cae3bb70df51","resolution":{"observed_at":"2026-08-11T21:36:09.164077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.168614Z","title":"Llava- next: Improved reasoning, ocr, and world knowl- edge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.168614Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:f566574c2a1f83f8c5737537e38b591f3976f1eeebb4dee3ff81592189c6c4ad","observation_id":"31e93e55-1923-46f8-af39-b93642bacee7","resolution":{"observed_at":"2026-08-11T21:36:09.168614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.173371Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.173371Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e9c39965ffc81696998c0cdda370a690f99320e996b7f0b6d7faa0ebb36c1259","observation_id":"0335a167-cb95-43b6-939e-f37cbfd44e9a","resolution":{"observed_at":"2026-08-11T21:36:09.173371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-20T10:21:12.032735Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-11T21:36:09.178312Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.178312Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:bc086eeab9107a263791a92ca54ae53ca244be07a30e73187599a5ceccf564d7","observation_id":"7d59b52b-546f-4ea8-a7e3-83f6f8565691","resolution":{"observed_at":"2026-08-11T21:36:09.178312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06327","last_updated":"2024-08-12T17:44:17Z","snapshot_observed_at":"2026-08-22T00:00:28.133406Z","submitted_at":"2024-08-12T17:44:17Z","title":"VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06327","snapshot_observed_at":"2026-08-11T21:36:09.183086Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.183086Z"},"links":{"cited_paper":"/paper/2408.06327","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:45879d0c05e511b94685b25e84be2a53314e259d60aa19ba334a7de760754086","observation_id":"336864a7-8cf6-4a1b-8532-329500031531","resolution":{"observed_at":"2026-08-11T21:36:09.183086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.187731Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.187731Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:156d8bdceb581a4ee9c4957bd62850632fff3a2be13e5f699130778ebe0863f0","observation_id":"6ef50f4c-4269-4fec-9829-e9aff34586f5","resolution":{"observed_at":"2026-08-11T21:36:09.187731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.192487Z","title":"Artificial empathy in marketing inter- actions: Bridging the human-ai gap in affective and social customer experience","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.192487Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:84ef23ce52bebc402ea651c2a17a9c20987297df6d92c65bdb3394522896f135","observation_id":"63352101-e00f-4da0-9aa6-a91ada5d8918","resolution":{"observed_at":"2026-08-11T21:36:09.192487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T21:36:09.197848Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.197848Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:b93e8c7141f0ed48c94598c18cd41b657786a7ace86358f4a155d567b5b86593","observation_id":"67b72738-45d9-411f-be7d-a0db5bbdb06f","resolution":{"observed_at":"2026-08-11T21:36:09.197848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.202647Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.202647Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:378397896e6505330d1986e515afe06ed6de2a736b259046e4605c2198fd3e67","observation_id":"c75b8675-174e-462e-8dc6-2a510442d302","resolution":{"observed_at":"2026-08-11T21:36:09.202647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T21:36:09.207178Z","title":"Math- vista: Evaluating mathematical reasoning of foun- dation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.207178Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:4cde4dd515f653530a10043beff45759576f8c731c7e8c7277eb17f48964387c","observation_id":"c41ebba7-946e-4008-acf2-34b7d0207535","resolution":{"observed_at":"2026-08-11T21:36:09.207178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.212407Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.212407Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:d521d89c2fb569128de779a0a801ac9f0641914f3247fbdf220aa029751a7693","observation_id":"a3dc9997-63c0-46f1-997f-778ba9605f0b","resolution":{"observed_at":"2026-08-11T21:36:09.212407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.216645Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.216645Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:2407ce835223c0a6b65fc01a06c4872192bf449b7afb09b2f29b28d82c60e15f","observation_id":"499b8b21-c2eb-4479-810f-63fd3d028345","resolution":{"observed_at":"2026-08-11T21:36:09.216645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13294","last_updated":"2023-05-09T11:04:43Z","snapshot_observed_at":"2026-08-17T17:45:02.917535Z","submitted_at":"2023-01-30T21:17:15Z","title":"Adaptive Machine Translation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13294","snapshot_observed_at":"2026-08-11T21:36:09.220579Z","title":"Adaptive machine transla- tion with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.220579Z"},"links":{"cited_paper":"/paper/2301.13294","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:510d230aeed292a3ed3b4a24f06910e83230ff93be7f1c11efeb18f95acf2f02","observation_id":"25952052-3eb7-4d32-b429-d9d4208edae6","resolution":{"observed_at":"2026-08-11T21:36:09.220579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04346","last_updated":"2024-12-06T07:43:34Z","snapshot_observed_at":"2026-08-18T04:29:55.173826Z","submitted_at":"2024-07-05T08:37:10Z","title":"MobileFlow: A Multimodal LLM For Mobile GUI Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04346","snapshot_observed_at":"2026-08-11T21:36:09.224772Z","title":"Mobile- flow: A multimodal llm for mobile gui agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.224772Z"},"links":{"cited_paper":"/paper/2407.04346","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e3bd608d66057124dd1e89ac35724b27887b818ee2bcdbcfdfc159d17171fee3","observation_id":"90494260-fcad-4515-803b-d0e2be654d97","resolution":{"observed_at":"2026-08-11T21:36:09.224772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13185","last_updated":"2024-10-31T02:35:03Z","snapshot_observed_at":"2026-08-20T01:07:43.436551Z","submitted_at":"2024-06-19T03:33:45Z","title":"LIVE: Learnable In-Context Vector for Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13185","snapshot_observed_at":"2026-08-11T21:36:09.228770Z","title":"Learnable in-context vector for visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.228770Z"},"links":{"cited_paper":"/paper/2406.13185","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:68efadacf373ba8a736fed22b235bad4140c7df9e42ebd92a7eae0a966118f95","observation_id":"cecbdb22-3761-423a-9c69-a6f89c5e5aca","resolution":{"observed_at":"2026-08-11T21:36:09.228770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09558","last_updated":"2023-09-18T08:13:01Z","snapshot_observed_at":"2026-08-16T14:59:54.215057Z","submitted_at":"2023-09-18T08:13:01Z","title":"Summarization is (Almost) Dead","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09558","snapshot_observed_at":"2026-08-11T21:36:09.232916Z","title":"Sum- marization is (almost) dead","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.232916Z"},"links":{"cited_paper":"/paper/2309.09558","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:4d486a582e6bb7b40ffdf82c85c946148038a5444d516768175d22dab739a7ac","observation_id":"83695d78-4b20-42fd-96b7-8f7342f54219","resolution":{"observed_at":"2026-08-11T21:36:09.232916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.237547Z","title":"Virtualhome: Simulating household activities via programs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.237547Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c3c2ab066d4114783df8aa95321264c6695a05bf9b9ba5d03ed3fc2e62455004","observation_id":"f844f83e-3012-4f85-8484-bf1bc9f5f493","resolution":{"observed_at":"2026-08-11T21:36:09.237547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.242109Z","title":"Imagination-augmented agents for deep reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.242109Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:ed2b89004600a11fb3f1deb05d11211b5f42beb809caef10f26295d83305780c","observation_id":"27da8b06-43e6-4aa3-8790-012945fdab72","resolution":{"observed_at":"2026-08-11T21:36:09.242109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08500","last_updated":"2024-01-16T17:00:36Z","snapshot_observed_at":"2026-08-17T15:38:45.204670Z","submitted_at":"2024-01-16T17:00:36Z","title":"Code Generation with AlphaCodium: From Prompt Engineering to Flow Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08500","snapshot_observed_at":"2026-08-11T21:36:09.246562Z","title":"Code generation with alphacodium: From prompt engineering to flow engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.246562Z"},"links":{"cited_paper":"/paper/2401.08500","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:b7de5b602bc3cb4f127ccba8966d58b6833f2ca41fd35411d6417631b8b36e47","observation_id":"2c67fb62-87a1-46be-879b-2fc57af3e811","resolution":{"observed_at":"2026-08-11T21:36:09.246562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-11T21:36:09.251713Z","title":"A systematic survey of prompt engineering in large lan- guage models: Techniques and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.251713Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:ecd7c5a2f68db4bc4a9b7c21cc241fded207275fecc954e2782e8ad7d6f3d415","observation_id":"52f1354d-da9b-443f-ae2d-6b102b19bc5b","resolution":{"observed_at":"2026-08-11T21:36:09.251713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.256537Z","title":"Image captioning for effective use of language models in knowledge-based visual question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.256537Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:595b095fe29c736850355030ae75e2188dfce67dd5fd00cc7130565ac4085d38","observation_id":"6e8f7bf9-41cb-45f4-a278-2119fa5ece3e","resolution":{"observed_at":"2026-08-11T21:36:09.256537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.261253Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.261253Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:37088ddc11d383e5bd4a7b410a1ed8813104d53b52d22982ce81509c561e6049","observation_id":"fef4287c-0f20-4bac-9ddf-9334fd047860","resolution":{"observed_at":"2026-08-11T21:36:09.261253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T21:36:09.265836Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.265836Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:8c813d72916348721acffc2e7af598f031ef9b4ebb9c5637a6a786b4143ab2d0","observation_id":"09cab709-0ac9-4184-9102-f83246593e71","resolution":{"observed_at":"2026-08-11T21:36:09.265836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T21:36:09.270532Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.270532Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:a81f4134af8ecee7da63107350d5e4f80513baa8e1c7a28baee80b67c7525f23","observation_id":"31b9b961-7e0f-48f4-8808-ca3fd46ace3d","resolution":{"observed_at":"2026-08-11T21:36:09.270532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T21:36:09.275304Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.275304Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:92ff37b9985a7af61d6616c7cba1c74f7f3cc4b4567d36736e32f306f5947870","observation_id":"eb495731-91bc-43af-b8d4-5f92929a7089","resolution":{"observed_at":"2026-08-11T21:36:09.275304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T21:36:09.279938Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.279938Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:2a0c04390f234fc184f800cfa4fb773f54dd9919db8af1b5827b30907dd5be69","observation_id":"97909eb9-2c68-4c75-a47d-9da59aae5e37","resolution":{"observed_at":"2026-08-11T21:36:09.279938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10727","last_updated":"2025-04-11T10:01:13Z","snapshot_observed_at":"2026-08-19T01:21:22.593463Z","submitted_at":"2024-01-19T14:44:37Z","title":"MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10727","snapshot_observed_at":"2026-08-11T21:36:09.284564Z","title":"Tool-lmm: A large multi-modal model for tool agent learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.284564Z"},"links":{"cited_paper":"/paper/2401.10727","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:4cbc50b3e281416cec9efd4bbd0f36434c3cd6d6c7e5bea1dc773065b0b11a5f","observation_id":"8d6b3a57-8554-4111-b53d-c96a3d1ec53b","resolution":{"observed_at":"2026-08-11T21:36:09.284564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-11T21:36:09.289737Z","title":"V oyager: An open-ended embod- ied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.289737Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:468ce404af1e6278ac97a285d14a8d95945270b2c8376ba0792350838e1dfa74","observation_id":"1f732bde-9bb5-4ef0-b662-28f412b1e363","resolution":{"observed_at":"2026-08-11T21:36:09.289737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.294670Z","title":"Qcap- tion: Video captioning and q&a through fusion of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.294670Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:b1aceb9bd8bde4dd04449fed05fb5331f6ade5a56dd02dfd529b87517fb69f8b","observation_id":"c4c391d9-0656-4cf4-9e75-85d99589764e","resolution":{"observed_at":"2026-08-11T21:36:09.294670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04334","last_updated":"2024-01-09T03:22:16Z","snapshot_observed_at":"2026-08-19T22:25:17.385990Z","submitted_at":"2024-01-09T03:22:16Z","title":"Large Language Models for Robotics: Opportunities, Challenges, and Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04334","snapshot_observed_at":"2026-08-11T21:36:09.299117Z","title":"Large language models for robotics: Opportuni- ties, challenges, and perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.299117Z"},"links":{"cited_paper":"/paper/2401.04334","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:670c673675f07cdc1ac10afc7ab8154807a70e5baa3a0715c7c1c8b7459d0420","observation_id":"eed7a586-31b0-4664-8169-54e925c88454","resolution":{"observed_at":"2026-08-11T21:36:09.299117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-16T13:42:20.592010Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-11T21:36:09.304053Z","title":"Mobile-agent: Autonomous multi-modal mobile de- vice agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.304053Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:bc859381057301d51614fae94670a8792f3d4fb822c6fb702380e079f618e7d2","observation_id":"791d9f35-9e26-4ce0-b59a-7a2061563c66","resolution":{"observed_at":"2026-08-11T21:36:09.304053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02210","last_updated":"2023-10-24T14:00:21Z","snapshot_observed_at":"2026-08-19T18:53:44.870873Z","submitted_at":"2023-04-05T03:49:06Z","title":"Document-Level Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02210","snapshot_observed_at":"2026-08-11T21:36:09.308985Z","title":"Document-level machine translation with large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.308985Z"},"links":{"cited_paper":"/paper/2304.02210","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:531a10f9c20e7b0770b356bc05f83f6d5b90941474eac46fdf4fa5c2bac601d2","observation_id":"ed2eade3-0dd5-41a5-add2-a10acba6b602","resolution":{"observed_at":"2026-08-11T21:36:09.308985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08184","last_updated":"2024-06-12T13:14:50Z","snapshot_observed_at":"2026-08-16T13:43:45.903326Z","submitted_at":"2024-06-12T13:14:50Z","title":"MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08184","snapshot_observed_at":"2026-08-11T21:36:09.313830Z","title":"Mobileagentbench: An efficient and user-friendly benchmark for mobile llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.313830Z"},"links":{"cited_paper":"/paper/2406.08184","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:75c21e1a52bddc804751242b42d1b5c3ab06785235e5f185964fc38c5193fd05","observation_id":"34bb36df-8a40-4271-8eef-6c6b6ce9b09c","resolution":{"observed_at":"2026-08-11T21:36:09.313830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.318773Z","title":"A survey on large language model based autonomous agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.318773Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:1977cfa6c645eaf7ec72829bb9c90363f19e8dc471e45cfdee06f83bf3d3c072","observation_id":"cecd93f5-2e93-4ed7-bc6c-723fc870eefb","resolution":{"observed_at":"2026-08-11T21:36:09.318773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T21:36:09.323230Z","title":"Qwen2-vl: Enhancing vision-language model’s per- ception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.323230Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c50177f1848ba7595157f3fb691468e0e762a42ab2b2030f3f6abb5b818b873a","observation_id":"d4a277c0-1e0a-472a-bb89-90abb73f5fa4","resolution":{"observed_at":"2026-08-11T21:36:09.323230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-11T21:36:09.328415Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.328415Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:c57f809c0fa744e1d0415b4d738c10f545ff8dc068ab7ea15db5695dabc0e973","observation_id":"1b530835-45ee-4dcd-aa3e-9ecc663f501b","resolution":{"observed_at":"2026-08-11T21:36:09.328415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.333258Z","title":"Chain-of-thought prompting elicits rea- soning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.333258Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:b3228cce9fb673269649ee7c0e15b7a172a870173fae5d43224745802b75a252","observation_id":"beb7e97b-11a2-42cf-bfeb-ae13103f55c2","resolution":{"observed_at":"2026-08-11T21:36:09.333258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01548","last_updated":"2024-04-02T01:28:44Z","snapshot_observed_at":"2026-08-16T14:04:28.927900Z","submitted_at":"2024-04-02T01:28:44Z","title":"mChartQA: A universal benchmark for multimodal Chart Question Answer based on Vision-Language Alignment and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01548","snapshot_observed_at":"2026-08-11T21:36:09.337291Z","title":"mchartqa: A univer- sal benchmark for multimodal chart question answer based on vision-language alignment and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.337291Z"},"links":{"cited_paper":"/paper/2404.01548","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:20ef616d2b7b898196a684d254da9d1b3590ae0d8d6877ba4f628cfc58cf4d54","observation_id":"0260d9fe-3979-416a-b8b2-b8aa6210a55f","resolution":{"observed_at":"2026-08-11T21:36:09.337291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.341754Z","title":"Intel- ligent agents: Theory and practice","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.341754Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:366c77f3a4e1d7a86eb18b6b3b200df9c98a3451e5b8f9be50605de10387a992","observation_id":"204ab3bc-dceb-49e3-9fbd-a7ee16241952","resolution":{"observed_at":"2026-08-11T21:36:09.341754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.345648Z","title":"A glance at in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.345648Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:93df09490ab3e4d7b712bed5e1f76481d5c0dd61cabae66498aaee7c53188156","observation_id":"0bd74fb2-6ac9-405a-83a5-48349851bb94","resolution":{"observed_at":"2026-08-11T21:36:09.345648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12488","last_updated":"2024-07-23T07:14:54Z","snapshot_observed_at":"2026-08-16T14:08:30.849938Z","submitted_at":"2024-03-19T06:54:33Z","title":"DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12488","snapshot_observed_at":"2026-08-11T21:36:09.349963Z","title":"Dettoolchain: A new prompting paradigm to unleash detection ability of mllm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.349963Z"},"links":{"cited_paper":"/paper/2403.12488","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e8ba8322d303c22b75cbb2c813ae61755845556aa4ced19540f994db4dadcacc","observation_id":"991490d4-96fd-4929-9e5d-a24d6058744e","resolution":{"observed_at":"2026-08-11T21:36:09.349963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-17T06:15:32.510873Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-11T21:36:09.354143Z","title":"The rise and potential of large language model based agents: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.354143Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:3fae0d0dc2363f488c2876bbd1bad9fb4d3acf3885e94bf732594f9d9a763c70","observation_id":"3c7483d7-c1cc-4879-aa9f-b1e625617948","resolution":{"observed_at":"2026-08-11T21:36:09.354143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-08-18T11:43:13.450548Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-11T21:36:09.358806Z","title":"Large multimodal agents: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.358806Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:d4843d970b54465183036da45dd9d7dd6ec7e8631d47d2336913a652691f5719","observation_id":"6b75a0a2-f551-4abb-a8fa-5dfcb60e6847","resolution":{"observed_at":"2026-08-11T21:36:09.358806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11674","last_updated":"2024-02-06T08:03:27Z","snapshot_observed_at":"2026-08-20T18:09:12.766230Z","submitted_at":"2023-09-20T22:53:15Z","title":"A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11674","snapshot_observed_at":"2026-08-11T21:36:09.363607Z","title":"A paradigm shift in machine translation: Boosting translation perfor- mance of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.363607Z"},"links":{"cited_paper":"/paper/2309.11674","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:6fe06168949e65f5ed75b93d7a136a41b4f2b9da5d2257ca3d177994d5e4df93","observation_id":"76555a79-5944-4ded-86ef-ddc863aec2e1","resolution":{"observed_at":"2026-08-11T21:36:09.363607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02224","last_updated":"2023-06-04T01:07:20Z","snapshot_observed_at":"2026-08-21T19:38:26.290447Z","submitted_at":"2023-06-04T01:07:20Z","title":"Auto-GPT for Online Decision Making: Benchmarks and Additional Opinions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02224","snapshot_observed_at":"2026-08-11T21:36:09.368161Z","title":"Auto-gpt for online decision making: Benchmarks and additional opinions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.368161Z"},"links":{"cited_paper":"/paper/2306.02224","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:30f1377a6eecc4dfbdd7f812dcca59ef89dfbc7434150aa2cee362b948d55110","observation_id":"d8487213-def1-4fcb-aa64-0299172b944b","resolution":{"observed_at":"2026-08-11T21:36:09.368161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.372857Z","title":"Exploring diverse in-context configurations for image captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.372857Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:4812d2414992e76526a5338ce34ae929ba4632a37eeba9e137629f46fe2e07cb","observation_id":"c918bfe3-d530-45be-b6ed-94781a47be75","resolution":{"observed_at":"2026-08-11T21:36:09.372857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.377298Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.377298Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e0a632743518c9475e37577e383340945a2e06c6bea3ea5c8fb8e3e1c859b196","observation_id":"8fa5f103-92e9-471e-a042-882f92a9761e","resolution":{"observed_at":"2026-08-11T21:36:09.377298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-11T21:36:09.381777Z","title":"React: Synergizing reasoning and acting in language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.381777Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:f038fd33b349df3600e252ee1b856acab1654d2140fd99117f31de6872b5b6f8","observation_id":"8bf58541-440e-4cec-9cb8-25b28ab2e68f","resolution":{"observed_at":"2026-08-11T21:36:09.381777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-08-21T07:48:51.700518Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T21:36:09.386551Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.386551Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:28c81cdf4a1a7d17886771749ec925550ade3e13e432600626df416aedc93974","observation_id":"d299f22b-4948-47b0-b907-188d7fb51566","resolution":{"observed_at":"2026-08-11T21:36:09.386551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T21:36:09.391392Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.391392Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:71a8393e0494835bf14fae15b45167cb697215e65c66532ec87481885dad3f32","observation_id":"73af8712-c1c0-4b49-a29b-129dbda5c1ac","resolution":{"observed_at":"2026-08-11T21:36:09.391392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-11T21:36:09.396491Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.396491Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:32aa327fa4abb09d9066d83144a88670d5d0700d34d414b166094633c19d4736","observation_id":"6d169184-9103-4bd1-97cc-a89ed4e17aca","resolution":{"observed_at":"2026-08-11T21:36:09.396491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T21:36:09.401490Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.401490Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:e236135967c2c5ca6c92bac5ddb70493e0e43762953ebc6b9f01d0154dff8f06","observation_id":"ea5e4b54-3e0b-4f4d-9ee5-47072a66dec5","resolution":{"observed_at":"2026-08-11T21:36:09.401490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.406415Z","title":"Mmmu: A massive multi- discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.406415Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:2819033e508810520faf267f51f38cd7deabc83894e84b713403397a57d87a01","observation_id":"ee2878c6-602b-4667-b1be-62b80f17641a","resolution":{"observed_at":"2026-08-11T21:36:09.406415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.411029Z","title":"Star: Self-taught reasoner bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.411029Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:0f3039c6634346246930d644f8880616f353ed12a77e2acfe562c859e85028f3","observation_id":"a0c21e55-b939-4b44-b525-3193f2df6b98","resolution":{"observed_at":"2026-08-11T21:36:09.411029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.415588Z","title":"Transporter networks: Rearranging the visual world for robotic manipula- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.415588Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:95e63aa65576237f6cd5543672487adf12ff729cce7e8e42cd50b136e21510a4","observation_id":"021b4051-b969-4c37-b467-b6a6d6de3096","resolution":{"observed_at":"2026-08-11T21:36:09.415588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.419922Z","title":"Large language models for robotics: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.419922Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:1e9e7f043f86f96997d683965773e3383968fa38e2660e4cc1a999cca9496962","observation_id":"72cce690-f700-413f-9491-5e59939442e6","resolution":{"observed_at":"2026-08-11T21:36:09.419922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:36:09.424513Z","title":"12 Prompting large language model for machine trans- lation: A case study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.424513Z"},"links":{"citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:fec54a945de0b8f730393801c84e930d794f903cef7a4a63ca84aa7a389aa608","observation_id":"67cc5245-6342-409f-b239-b3ede1801e52","resolution":{"observed_at":"2026-08-11T21:36:09.424513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:02:39.651530Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":158},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 100 of 158 outbound references and 2 inbound Pith citation observations for arXiv:2412.04531."}