{"as_of":"2026-08-14T15:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43e2134fa7f39f1c37ebfcd1bdca30d50a403cddbbb6f8ba8a99589a220ee510","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:18:59.692988Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T15:38:30.195236Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-08-03T01:02:34.091340Z","title":"Mm-browsecomp: A comprehensive benchmark for multimodal browsing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-08T07:23:55.696942Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.091340Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:17afaf3caa13570d62d7c27fa0a65a61caa74f55f7d00362b98b9225d9bbb15c","observation_id":"32b42022-5d2f-4b8e-9ab1-c7de86b259c1","resolution":{"observed_at":"2026-08-03T01:02:34.091340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T07:44:02.827006Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2603.20633"},"observation_digest":"sha256:5a2b8339c8fe969a524efc266c28671ba9679bfdbaa83f22460a89ccd5341738","observation_id":"7dfbe0e6-6255-4e38-91fa-5e5068751497","resolution":{"observed_at":"2026-05-15T07:45:14.386566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2604.04017","last_updated":"2026-04-05T08:29:52Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T08:29:52Z","title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T17:31:08.575993Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2604.04017"},"observation_digest":"sha256:0fc0be1e0a4b64c81da76a2bc64e2416adc5581748bc19505c342c3bfa98c78c","observation_id":"955b1706-b724-4971-8419-1b77a9eecc59","resolution":{"observed_at":"2026-05-13T17:33:02.334719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-08-11T09:04:45.578410Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:40:32.137708Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2604.12890"},"observation_digest":"sha256:9cc1d6701527b1c8c28586416b6f507961a8bf6cb1006fae7c242e54ac89241c","observation_id":"10cde9e7-b8a9-465c-988c-8ce1043ce649","resolution":{"observed_at":"2026-05-11T10:01:04.548823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2604.14448","last_updated":"2026-04-15T21:54:27Z","snapshot_observed_at":"2026-08-11T16:16:08.455388Z","submitted_at":"2026-04-15T21:54:27Z","title":"MARCA: A Checklist-Based Benchmark for Multilingual Web Search","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T12:54:27.110593Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2604.14448"},"observation_digest":"sha256:1fbdc83c2d0a46e4ba7f9473c4e19ecb687e3ca2f618ec63989cdf576214b74a","observation_id":"c577a077-2d56-4d06-b41b-be1626d4fef4","resolution":{"observed_at":"2026-05-10T12:55:24.292789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.10832","last_updated":"2026-06-05T07:49:38Z","snapshot_observed_at":"2026-08-11T08:57:01.291196Z","submitted_at":"2026-05-11T16:49:36Z","title":"Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:40.042348Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.10832"},"observation_digest":"sha256:c7c3828c7cd0553ad73991107196c00fd9139885c432f88f4c336a0b1e279735","observation_id":"1b1ad998-ae3b-4b90-a74c-345572e497d9","resolution":{"observed_at":"2026-05-12T06:26:26.286747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.10832","last_updated":"2026-06-05T07:49:38Z","snapshot_observed_at":"2026-08-11T08:57:01.291196Z","submitted_at":"2026-05-11T16:49:36Z","title":"Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:30:28.649803Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.10832"},"observation_digest":"sha256:a5557edb516ef96c699144cef96a46692347fb77eba8c9a0df2d0346283b773c","observation_id":"e7561edf-ca1c-41ae-828f-3455364bcdd8","resolution":{"observed_at":"2026-07-01T13:55:46.331622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.12481","last_updated":"2026-05-12T17:57:04Z","snapshot_observed_at":"2026-08-09T08:12:42.231591Z","submitted_at":"2026-05-12T17:57:04Z","title":"ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T03:51:54.401200Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.12481"},"observation_digest":"sha256:b8c7957c9712fe5c9e07cabe31bb21a24dbb1ff231a2a440ea6a51769b6899f2","observation_id":"18eaf2f7-a8a9-4fb7-8da1-8cf1fd751645","resolution":{"observed_at":"2026-05-13T03:52:12.448979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.17946","last_updated":"2026-05-20T03:33:36Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:03:48Z","title":"SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-20T10:08:56.397296Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.17946"},"observation_digest":"sha256:e5c9c50d6d0d1e61671d450d0cc5fd54847e6432ae758c2482713b677d2b01ff","observation_id":"ea77197f-3f7e-49f3-b743-2f77a2caa3a7","resolution":{"observed_at":"2026-05-20T10:13:11.959110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.17946","last_updated":"2026-05-20T03:33:36Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:03:48Z","title":"SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-21T08:49:32.503461Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.17946"},"observation_digest":"sha256:1319a16fe6d37104f4f36bbe156823001e6184ffff01903ca6023177d7bc3428","observation_id":"239f26a6-f098-474f-9899-abcb96895546","resolution":{"observed_at":"2026-05-21T08:49:53.430701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2606.07689","last_updated":"2026-06-05T06:25:11Z","snapshot_observed_at":"2026-08-13T08:23:08.184557Z","submitted_at":"2026-06-05T06:25:11Z","title":"Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T22:20:53.187362Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2606.07689"},"observation_digest":"sha256:f17c661e99281bf46cbf709b619a7e9a02757651570e6f0af3babd2ba114ccbd","observation_id":"9a2dc7dd-27e7-4ec9-97a4-ebf9e7aa6f19","resolution":{"observed_at":"2026-07-02T16:47:10.205636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2606.10460","last_updated":"2026-06-09T06:15:36Z","snapshot_observed_at":"2026-08-13T15:00:10.042585Z","submitted_at":"2026-06-09T06:15:36Z","title":"LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:41:35.986601Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2606.10460"},"observation_digest":"sha256:dbe170c0490ebdc71f74408a7971d046ca07b1c5b2d4c80f14d44a9ad067a50e","observation_id":"d01175b6-838b-4025-aef4-bad8c086cc24","resolution":{"observed_at":"2026-07-03T04:47:37.848395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:2fe28d931d31b7c58bd2422f89d250d74a1d0da72363576ffe87db2cb67a5948","observation_id":"dbc08aa0-a0ca-4afc-8b18-4b3beb0f6fd1","resolution":{"observed_at":"2026-07-02T19:07:17.131815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-13T01:42:44.442044Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:811d66abeb9e4906f71b62487b30ade75dbc05404c0dc0803b60572e69f4c02e","observation_id":"0605d5af-1a04-4902-8244-c00b060f8450","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-08-03T15:38:30.195236Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29002","last_updated":"2026-07-31T04:00:15Z","snapshot_observed_at":"2026-08-08T13:54:24.570258Z","submitted_at":"2026-07-31T04:00:15Z","title":"MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T15:38:30.195236Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2607.29002"},"observation_digest":"sha256:7a251a0047502a3969abce902ca8ef05f5c621c10764b42acb21f798db4ac5d9","observation_id":"fcdcc24d-bda5-43e1-a8af-9e8a3a4c3b6f","resolution":{"observed_at":"2026-08-03T15:38:30.195236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13186/citation-record","integrity":"/paper/2508.13186/integrity","json":"/paper/2508.13186/citation-record.json","paper":"/paper/2508.13186"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T20:18:52.178365Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.178365Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:9034749e2c7b186b15e4616eebab0fa5691b841301534d4356b64f4d76f6c78e","observation_id":"c2260c22-16f8-464c-8c5e-dd2b48c0cdb8","resolution":{"observed_at":"2026-08-05T20:18:52.178365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:18:52.262125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.262125Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:bc33e71757d1339914fab1195703cc35963b56b195ca90b663c97773f6af937e","observation_id":"1e50ed77-ef65-4b12-a17c-d1061f95e96f","resolution":{"observed_at":"2026-08-05T20:18:52.262125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.903264Z","title":"Deepresearch bench: A comprehensive benchmark for deep research agents","venue":null,"work_id":"ed097e05-04bf-4669-94cf-aebd208486c7","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.385826Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:fcfc0a976673df47af9573047d31d974ee59c14acaa8c2e7bbdfe02c55f96a5c","observation_id":"9e8ba05a-64a0-4145-ad7b-3111070f3929","resolution":{"observed_at":"2026-08-05T20:19:06.999286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.694651Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"d6012f99-34bd-4771-b3f2-2dbfe47877ed","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.509153Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:f440e8e509aeabdb3681459110bfdbc5e529f6414a0b8a50a1c574d0a54b53e8","observation_id":"5ba2930b-e602-49d7-9146-a92bcd5e1224","resolution":{"observed_at":"2026-08-05T20:19:06.829215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.476719Z","title":"Gaia benchmark: Results public dataset, 2025","venue":null,"work_id":"70a2be96-0a41-46f6-9bd2-1fd14ceb8d78","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.642402Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:4d4be5f560f4b99665ca4c56132d15f56c918143b6dc9d6f85a61cbb0b351922","observation_id":"980e99a2-4868-4577-a606-dec42c95370c","resolution":{"observed_at":"2026-08-05T20:19:06.549216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.367256Z","title":"Gemini Deep Research","venue":null,"work_id":"45119c15-57a8-4d41-8d10-6e06ab2093ce","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.749398Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:f795c59fd5da67ed7cf65f6b8a77a6a08e7e336e7226a758a3dae97c4c8baee3","observation_id":"2e70f5e7-7a54-40c2-919c-0a7e20d36870","resolution":{"observed_at":"2026-08-05T20:19:06.408320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.188663Z","title":"Gemini 2.5","venue":null,"work_id":"42a7bc3b-a6bb-40b1-b1be-a0e1db5f929e","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.870299Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:fce85465985d05f9fd9319d2126e1800b3b1456e57713231177dc41d12c3cb19","observation_id":"9fd53ec8-55cf-45e1-bed8-e8bbef5a76c7","resolution":{"observed_at":"2026-08-05T20:19:06.285802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.940767Z","title":null,"venue":null,"work_id":"42f6cc98-96b4-4955-aa9d-1a111995f5f1","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.987907Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:345ecb2ea094e37fc0a1cf9149307e5fcb579e6f5681a48ea4e3aa68fbdede84","observation_id":"1e3bf27e-0fd2-4775-ba3d-c37494eceeb3","resolution":{"observed_at":"2026-08-05T20:19:06.059515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-09T21:47:22.232349Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-05T20:18:53.119930Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.119930Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:499d676e0acebc789d6dd36cdef66340f667c5feba011a2ea48e1cf1043935f6","observation_id":"9db7f7ba-07db-43c4-9398-71191a188618","resolution":{"observed_at":"2026-08-05T20:18:53.119930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.722951Z","title":"Owl: Optimized workforce learning for general multi-agent assistance in real-world task automation","venue":null,"work_id":"f26e2953-b93e-4b65-9649-c4df8418dc58","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.219214Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:0f072651f76efbd6689d61136ef699451a833ebb3ff94e7d08997acaa132af26","observation_id":"3a36b098-1b49-43af-8da3-d64eeb305081","resolution":{"observed_at":"2026-08-05T20:19:05.806827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T20:18:53.300540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.300540Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:c3f821befeb5b8861c85a6636602e3a63466a69cd476f28cb6aefcdac76628e0","observation_id":"b22afdd6-2d01-456c-a6e0-9273d4e4068c","resolution":{"observed_at":"2026-08-05T20:18:53.300540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-08-12T22:41:32.074319Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-05T20:18:53.545779Z","title":"Mmsearch: Benchmarking the potential of large models as multi-modal search engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.545779Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:6b8bd75d2d3cc1c842532312c4a8853d157bdadeb89a3c85a2c56dffec8c90c5","observation_id":"48d06288-8d2f-4cc0-b863-2d85b7944321","resolution":{"observed_at":"2026-08-05T20:18:53.545779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T20:18:53.678366Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.678366Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:6971d7bfd40f2aca612ebef3307d5f211d59955c9f24e8f6214ee03666b28ab2","observation_id":"91067c32-3e30-42e4-ab33-d265c44b0950","resolution":{"observed_at":"2026-08-05T20:18:53.678366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.437107Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"97243ef6-063b-4885-83a1-29d8e95a1ecb","year":2014},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.814353Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:365b167fcdeeef9b1b810b53759b819e4bc4f3f45128ed07900ba3eba8198f8c","observation_id":"4b43a62b-5a18-4696-8cac-f3432010874d","resolution":{"observed_at":"2026-08-05T20:19:05.566008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T20:18:53.961684Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.961684Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:7b1a5b4683f6e542cab89bec08ab3c6cda5c410d404d20bb6e447aa318862597","observation_id":"b657d496-2232-434e-a6dd-8ad450646490","resolution":{"observed_at":"2026-08-05T20:18:53.961684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-14T09:18:55.769794Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T20:18:54.074131Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.074131Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:d9859a23c4797f9cb44369a49d44b0e19938ba0fb3b7e14d2dbad93a4b395051","observation_id":"26a51221-4347-4ac5-88fe-8b51366e9d8b","resolution":{"observed_at":"2026-08-05T20:18:54.074131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-05T20:18:54.365562Z","title":"Websailor: Navigating super-human reasoning for web agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.365562Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a585b1bb9f49861313f9c5e9d55162a6f2676a2bec787d666d9976f57fdbc393","observation_id":"47559cc3-1215-4f34-ac03-5d1916af0066","resolution":{"observed_at":"2026-08-05T20:18:54.365562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14550","last_updated":"2024-11-05T16:51:40Z","snapshot_observed_at":"2026-08-12T23:38:07.489708Z","submitted_at":"2024-06-20T17:57:51Z","title":"GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14550","snapshot_observed_at":"2026-08-05T20:18:54.512884Z","title":"Graphreader: Building graph-based agent to enhance long-context abilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.512884Z"},"links":{"cited_paper":"/paper/2406.14550","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:bd1cbdb973c961635762e982ab2a07273b08888cda2df07901eb916d2a728fd1","observation_id":"3e0fe0ed-8d56-4ed1-b771-f3d637093846","resolution":{"observed_at":"2026-08-05T20:18:54.512884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-05T20:18:54.670109Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.670109Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:d823f84902f90c1dcdaf4438410b57cf1a33f19ca18c8e829049c2b01b5f1d9e","observation_id":"ff170901-0152-437e-83e6-f05db41890b8","resolution":{"observed_at":"2026-08-05T20:18:54.670109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18053","last_updated":"2025-06-05T16:13:05Z","snapshot_observed_at":"2026-08-12T20:19:04.663647Z","submitted_at":"2025-04-25T03:54:24Z","title":"DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.18053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.18053","snapshot_observed_at":"2026-08-05T20:19:00.210071Z","title":"DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models","venue":"cs.CL","work_id":"f589cfa6-09e0-4b9c-b494-8bb718be8269","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.813869Z"},"links":{"cited_paper":"/paper/2504.18053","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:7eb08e6cdd45d7fc2d29dc60fcdee455a255155f5e52d1eba514f289e4685237","observation_id":"701e583d-73bb-48cf-91f2-fe35ab599e05","resolution":{"observed_at":"2026-08-05T20:19:00.281226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.224350Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233","venue":null,"work_id":"6700376a-bc38-4303-b701-ccba4c855ee4","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.927315Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:79695f35330f5cc9f9eefe5fdd506f4fc23e90afaa2b9428a9c681cbd5bd20cf","observation_id":"e8ff93a8-1712-44d8-96b0-e1e6770e55dc","resolution":{"observed_at":"2026-08-05T20:19:05.321742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T20:18:55.001509Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.001509Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a15aa418c0a977be6174ef961e24f48f33aabe628f70f6cc21214ea196c43de5","observation_id":"6ee1cf06-04b4-4a20-9ce8-0a0c47c1633a","resolution":{"observed_at":"2026-08-05T20:18:55.001509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T20:18:55.099600Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.099600Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:57eb7178e38c061da692219c8e15d5565c4144a8f04aeb864e83aa40475f0cbe","observation_id":"43ca75dc-0843-4d8f-86ae-2e923ea510fd","resolution":{"observed_at":"2026-08-05T20:18:55.099600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.934164Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"42a485a7-b7b1-4cb7-9da7-a52a545685f9","year":2021},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.244691Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:65aa6af1643dffaae1f57cea26ff86a26a71a570f4b81ba85c11bf7d5521f46e","observation_id":"7a88fb56-988b-4e6e-ac07-cdb7820737d8","resolution":{"observed_at":"2026-08-05T20:19:05.036681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:55.347792Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.347792Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:2e85d3a4161becbba45c6fd60328870adfb8ca5cef4f78a15402d0f563c49321","observation_id":"716518fc-6e9b-404a-9976-484cfa8746a2","resolution":{"observed_at":"2026-08-05T20:18:55.347792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.723846Z","title":"Llama 4 Herd","venue":null,"work_id":"a62ee55e-3945-4221-9a35-5d25521c4e3f","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.456093Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:be86fa19c3bd7a3f553ced3f00b7504e494a1f0bebf018e1ce155878fa203757","observation_id":"d7c3e2c4-ce84-4bbc-aed6-737c9031f4a6","resolution":{"observed_at":"2026-08-05T20:19:04.820616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:55.620908Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.620908Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a5080329717912d02621a11d24205bc6cd31783889ed43ecfd9562c1058162cd","observation_id":"62a04ec3-a64a-444e-8858-90d99fb2b72a","resolution":{"observed_at":"2026-08-05T20:18:55.620908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.406333Z","title":"Microsoft Copilot","venue":null,"work_id":"45b36bfb-d1c9-497f-9695-1028012e7b44","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.821777Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:b20bf6a52733936f812ae6fcf4402bda0eafd211ace7eb70c4bfc3aa612771ef","observation_id":"130af66e-cac6-4b2d-bf13-fdc1f1deea5e","resolution":{"observed_at":"2026-08-05T20:19:04.567835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T20:18:55.993286Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.993286Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a4d63acddaa90a2a912e5c2b2c45ed69066485c9c00144275cc103988def2f87","observation_id":"3e5d107c-3999-4f69-9ceb-8d3e802bbe91","resolution":{"observed_at":"2026-08-05T20:18:55.993286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.180520Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"e4a7ad88-be54-4ad5-878e-c3f33aabd7b3","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.139228Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a72ed2f8b231979d19905156d1269f0819cb07b1f5db39610082a85451f580e3","observation_id":"fbbd6bc4-813c-4bc0-bedc-b90fc1c77007","resolution":{"observed_at":"2026-08-05T20:19:04.278759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:03.877027Z","title":null,"venue":null,"work_id":"f705d541-03a8-4e12-98d9-7ba4ebf5e5d1","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.288187Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:edfecec19c7b1454ee3306993118dc13345aba2f2f450997af7a163d7b16ca61","observation_id":"573a8663-75a4-4add-a630-b97470d60b22","resolution":{"observed_at":"2026-08-05T20:19:04.032453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:03.538966Z","title":"Introducing deep research","venue":null,"work_id":"20c247fd-5568-4f11-96a9-8e4cf87171f1","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.434664Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:bbf5dedaff7c5214b55a2d3bca2ffac24d827a46a22d0b088a2f3effe78e404d","observation_id":"8b7c6f4a-def0-450a-9bd7-176c2040c44a","resolution":{"observed_at":"2026-08-05T20:19:03.667177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:03.158318Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"5ffbcefb-fd22-490a-9a9f-6a18c8609727","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.608692Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:10f03fe7364a82e1a81e5c2e4ab8bf4266e44bc628abac2ee604e22114333ca9","observation_id":"85dbd799-a76d-441d-8898-668a038f568e","resolution":{"observed_at":"2026-08-05T20:19:03.353056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.954412Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"bb164564-9860-4c1b-9693-a0af219446e8","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.833485Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:1beb3d4e3c90ace8b03e54323ba430fc9187c4aba01b7e5df2498ec94c76e3dc","observation_id":"cb0ef2da-5c1e-4578-be05-077e9497a513","resolution":{"observed_at":"2026-08-05T20:19:03.029226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:56.950277Z","title":"Training powerful llm agents with end-to-end reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.950277Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:6561bf2be3b9e75ab2c96f17ad72bfde531b25eaf9ea0baf78d3a88e5b686df2","observation_id":"d573d668-9369-4da7-b628-5b26ad2730ce","resolution":{"observed_at":"2026-08-05T20:18:56.950277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.671473Z","title":"Introducing perplexity deep research","venue":null,"work_id":"676f44b3-9707-4cb4-8639-c70617a48885","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.070228Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:ce9c796cfc97672aa309e0afe901b666c124da2d795c07bdcd60a0973a3b4ca9","observation_id":"e9453e73-4b7d-4867-9ddf-764b0cfd5338","resolution":{"observed_at":"2026-08-05T20:19:02.794314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.419698Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"76b704f1-ee73-451a-b5c0-ba73126ef98a","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.196991Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:088f717aafc8dec1bf14a2fb9c8048173c8b7d79c4d5b192e4a547eab327c476","observation_id":"09f53ad0-7f78-4d69-a1a6-2e930e0a1bbf","resolution":{"observed_at":"2026-08-05T20:19:02.505255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.199245Z","title":"Hal: Gaia leaderboard, 2025","venue":null,"work_id":"bb4044e1-330b-48d8-9ecf-ed6e8a318cc5","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.341760Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:887ce8df9831c1fae5c9ea1d80ec849a45c135cdd2a8ef17c2cdb957581690e5","observation_id":"ac9c6cd1-2543-42f0-9bf1-5102c3330527","resolution":{"observed_at":"2026-08-05T20:19:02.330575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.001985Z","title":"Humanity's last exam leaderboard, 2025","venue":null,"work_id":"5ad8ba75-14b6-4fd0-a2ab-d83dc4a2b9b6","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.480233Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:bfaa907bc0b054a507e07c5b8bf1f53865e25400e7701d1ba9394daf24e0b53d","observation_id":"95a63a2e-fdea-4aa9-acf2-33a40543bd8e","resolution":{"observed_at":"2026-08-05T20:19:02.110436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T20:18:57.605443Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.605443Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:fcc4c39e8a4acd6d4083faae86d918478dbce891ef4e059db732c4e38d7f1194","observation_id":"59ab65c4-816a-4034-8bd3-f84843dc02e6","resolution":{"observed_at":"2026-08-05T20:18:57.605443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T20:18:57.792273Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.792273Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:64ee58ee6ad2b98d4b9982c70e3bcf9f2fa66654bd3741eefcdc3e5d8065a735","observation_id":"842b6078-8765-4205-bc5c-d899be24ff4f","resolution":{"observed_at":"2026-08-05T20:18:57.792273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:57.917652Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.917652Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:bd86d796911d02f3bd8ecc723935a6b28f1b0aab26a6fa49c7e4af55786e443f","observation_id":"95ab613e-59a0-4a92-a81f-b2e2b37fc1fa","resolution":{"observed_at":"2026-08-05T20:18:57.917652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18017","last_updated":"2025-06-03T05:34:30Z","snapshot_observed_at":"2026-08-14T15:15:49.167517Z","submitted_at":"2025-02-25T09:26:12Z","title":"ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18017","snapshot_observed_at":"2026-08-05T20:18:58.053520Z","title":"Vidorag: Visual document retrieval-augmented generation via dynamic iterative reasoning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.053520Z"},"links":{"cited_paper":"/paper/2502.18017","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:e1bfede2eff8e4c802bc810f700bf9bfcf6e6f7366a43262e8678e8138592d53","observation_id":"7b9cabd8-ade0-4f3d-860f-c9e3128ad341","resolution":{"observed_at":"2026-08-05T20:18:58.053520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-14T05:05:23.381011Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T20:18:58.169572Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.169572Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:e86c3dfe038a932176c13ea2d8ca221dc32095109203a382386432a392c15aed","observation_id":"2cc5c784-86cf-42bb-8fe8-8a4622da8dc3","resolution":{"observed_at":"2026-08-05T20:18:58.169572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-13T03:19:29.377723Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T20:18:58.349502Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.349502Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:8a5426011182006eeb529214b42815f3b8484a071da67d531c9a259a8bd24990","observation_id":"9d8fe418-16a1-4b2b-930b-8e26a4138302","resolution":{"observed_at":"2026-08-05T20:18:58.349502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:01.684126Z","title":"Webdancer: Towards autonomous information seeking agency","venue":null,"work_id":"1f37a10c-7373-4bf9-8ce7-b09f9a09ddb8","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.484673Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:f4ec60c6e2566cd0adde04e033d910fcd03a7c958157dbd8027f04a1a88a2d79","observation_id":"cd6c2255-771d-4b23-b37a-9ac36d45ea3a","resolution":{"observed_at":"2026-08-05T20:19:01.803250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-08-14T00:24:35.202988Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-05T20:18:58.629661Z","title":"Mmsearch-r1: Incentivizing lmms to search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.629661Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:ace412f0d59e598d806a98c569b01ee257f86dbb86974a98c78c020038c98365","observation_id":"66900148-4dd5-4a78-bd8c-4b461a3f19fc","resolution":{"observed_at":"2026-08-05T20:18:58.629661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:01.445772Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"1982df4f-b970-4077-843e-43a321c8d698","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.773879Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:9b81f094355992ce6840afd76a05091318f22d0e80e0f4052c8058e7e5c8d826","observation_id":"60b9b2eb-587b-4a11-aabb-82b6f0534e40","resolution":{"observed_at":"2026-08-05T20:19:01.513249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:18:58.951425Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.951425Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a7a60809b2d70b740ead8ba46cf04909f492535688d22882865c0cf0c1535222","observation_id":"ba5ab07c-e2b2-4183-9397-70fd248446c0","resolution":{"observed_at":"2026-08-05T20:18:58.951425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:01.157880Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"b6f839e4-5be0-42c2-bb50-7a140dcc4cd8","year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.075373Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:82276974219676801cb7280643dab303b40dabeacf67001665fd4f7f775fc53b","observation_id":"2c1f60de-14ea-46be-94b2-1d6158e391a2","resolution":{"observed_at":"2026-08-05T20:19:01.262964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T20:18:59.256090Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.256090Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:aca5a56411a3c5709d368b6dc40feee54de7aa85d00f0b5a71929c4773bbd3a1","observation_id":"4ac9d3b7-609f-402d-9542-65b47ff08e6c","resolution":{"observed_at":"2026-08-05T20:18:59.256090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:00.893435Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"fd90ad12-2847-491e-b9dc-66a0faa19cf5","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.386038Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:84d807a7c9bde1cc869fe25f72c491c2de629d9c557cb53d39ee9998fee190f2","observation_id":"f9c9358e-cfb8-4e7c-b1ee-a3fa940e5622","resolution":{"observed_at":"2026-08-05T20:19:01.004390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-08-13T07:33:28.197077Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-05T20:18:59.503443Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.503443Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:6a6acea493ec5e8ab353698dc73226b2e08ce2eef76c72cbbf4924e7d73fe614","observation_id":"d35a115d-3916-4428-bb43-9562a5110c40","resolution":{"observed_at":"2026-08-05T20:18:59.503443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19314","last_updated":"2025-05-01T05:02:57Z","snapshot_observed_at":"2026-08-12T22:48:20.392456Z","submitted_at":"2025-04-27T17:32:43Z","title":"BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19314","snapshot_observed_at":"2026-08-05T20:18:59.573267Z","title":"Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.573267Z"},"links":{"cited_paper":"/paper/2504.19314","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:f874bfee2d2fb0fd1a0c7cc59653bba5b7a80372db98ac6b760c1055281f629c","observation_id":"fdc03570-e332-412b-9fd4-e978e98ef471","resolution":{"observed_at":"2026-08-05T20:18:59.573267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:00.627285Z","title":"deepflowio/deepflow","venue":null,"work_id":"fdb2871a-3556-4bd7-992b-0736cb67bfd8","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.692988Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:f7c19c5923aa242f51494c9f1d94b9fd2487daa17c455d293a73c2f59f127fd6","observation_id":"fa68709a-deef-4e9d-92ca-8d0303af9973","resolution":{"observed_at":"2026-08-05T20:19:00.735479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 15 inbound Pith citation observations for arXiv:2508.13186."}