{"as_of":"2026-08-09T08:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2381d6d1649d3e1eff61d75c6f00d608ed41b34e3a206212d92f49683bb68b5d","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:32:33.689457Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:20:37.943280Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:55:01.576018Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-08-03T21:20:37.943280Z","title":"Textquests: How good are llms at text-based video games?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.15830","last_updated":"2026-07-20T14:51:40Z","snapshot_observed_at":"2026-08-07T04:36:26.858564Z","submitted_at":"2025-11-19T19:38:05Z","title":"Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T21:20:37.943280Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2511.15830"},"observation_digest":"sha256:6ccc1cc98fdd064e3262ffd35bf04f47809791b897de07dfd2d1f30a6112024d","observation_id":"45cd63f8-f908-43a4-b57f-8de2389e77a0","resolution":{"observed_at":"2026-08-03T21:20:37.943280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":"2507.23701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-06-30T19:55:01.576018Z","title":"Textquests: How good are llms at text-based video games?","venue":null,"work_id":"9c608aaf-2fe6-4b51-9a1a-35870878a0e5","year":2025},"citing_paper":{"arxiv_id":"2604.11655","last_updated":"2026-04-13T16:08:03Z","snapshot_observed_at":"2026-08-06T03:07:47.979559Z","submitted_at":"2026-04-13T16:08:03Z","title":"RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:34.750723Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2604.11655"},"observation_digest":"sha256:01bb58996ce641b3e0e72bef493e80597de93e95b0b87af4fc930b968204605c","observation_id":"6e43c9bd-e4ab-4596-ace1-ce68d015e3ad","resolution":{"observed_at":"2026-05-11T10:56:02.428353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":"2507.23701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-06-30T19:55:01.576018Z","title":"Textquests: How good are llms at text-based video games?","venue":null,"work_id":"9c608aaf-2fe6-4b51-9a1a-35870878a0e5","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:24.844859Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:02ad4e2ae5274ebe42cb9f3a5afd890c0b8ebef439a45102799d1e9a8108f0ae","observation_id":"6f946362-47eb-4357-acd2-754e05e1d385","resolution":{"observed_at":"2026-05-12T03:26:19.100599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":"2507.23701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-06-30T19:55:01.576018Z","title":"Textquests: How good are llms at text-based video games?","venue":null,"work_id":"9c608aaf-2fe6-4b51-9a1a-35870878a0e5","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:28.552513Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:421ad0f981f844be96c0dd06a36f5f69f3aca337eb07ea3bb1954a2f65c89c96","observation_id":"18599c8e-3c0d-43e6-829e-f524f7c865e1","resolution":{"observed_at":"2026-05-13T06:47:26.910724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":"2507.23701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-06-30T19:55:01.576018Z","title":"Textquests: How good are llms at text-based video games?","venue":null,"work_id":"9c608aaf-2fe6-4b51-9a1a-35870878a0e5","year":2025},"citing_paper":{"arxiv_id":"2606.12429","last_updated":"2026-05-14T23:12:14Z","snapshot_observed_at":"2026-08-01T13:39:04.365332Z","submitted_at":"2026-05-14T23:12:14Z","title":"Muse Spark Safety & Preparedness Report","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-30T19:49:14.463992Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2606.12429"},"observation_digest":"sha256:b3b9084e24fa6fb5e52c8c4869fbf818fb39b82ff4c9cf437444c30ac29c15c2","observation_id":"eb0af504-3f2e-4f4a-95c6-464ffaad9468","resolution":{"observed_at":"2026-06-30T19:55:01.578039Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-08-02T16:36:34.700284Z","title":"Textquests: How good are LLMs at text-based video games?arXiv preprint arXiv:2507.23701,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18239","last_updated":"2026-04-10T03:16:51Z","snapshot_observed_at":"2026-08-08T06:11:02.901254Z","submitted_at":"2026-04-10T03:16:51Z","title":"SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T16:36:34.700284Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2607.18239"},"observation_digest":"sha256:e1758ce9372d5489bb1da04a59eafbe4232bdc4d8ce2a423218b7ddbd327c559","observation_id":"dfdc32e5-0e37-4fb2-8617-9d77630073e2","resolution":{"observed_at":"2026-08-02T16:36:34.700284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23701","snapshot_observed_at":"2026-08-01T09:29:01.220666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20767","last_updated":"2026-07-22T22:32:34Z","snapshot_observed_at":"2026-08-07T22:52:37.493248Z","submitted_at":"2026-07-22T22:32:34Z","title":"Rushes: A Human Preference Dataset for Pluralistic Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T09:29:01.220666Z"},"links":{"cited_paper":"/paper/2507.23701","citing_paper":"/paper/2607.20767"},"observation_digest":"sha256:1eedc2a8f152977f215f9a8aefc8ef34b554514349b7ca5cec482b9e9b0e0397","observation_id":"c4489fd4-0148-4f49-af23-cc7ebf6ddca2","resolution":{"observed_at":"2026-08-01T09:29:01.220666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.23701/citation-record","integrity":"/paper/2507.23701/integrity","json":"/paper/2507.23701/citation-record.json","paper":"/paper/2507.23701"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:34.010406Z","title":"This is a fake!","venue":null,"work_id":"65e5b52f-b928-48b3-8aa4-e2a713702164","year":2021},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.689457Z"},"links":{"citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:fa4c74d6af06fd8f28d4f9398702bdf0b32b974d0c1f6cc71518505ab802ee78","observation_id":"9cc5aa1a-e6e6-45a3-b825-0342e541670f","resolution":{"observed_at":"2026-08-06T10:32:34.013674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-06T10:32:33.646495Z","title":"Gemini Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.646495Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:eae60f50bbb4d0bc1fba5136c19b7ca8d335cab937422753fe759ae095ab3daf","observation_id":"2c8caff6-8dcb-45c4-9c85-80b1ad948731","resolution":{"observed_at":"2026-08-06T10:32:33.646495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05398","last_updated":"2020-02-25T19:36:33Z","snapshot_observed_at":"2026-08-08T13:49:38.960069Z","submitted_at":"2019-09-11T22:41:00Z","title":"Interactive Fiction Games: A Colossal Adventure","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05398","snapshot_observed_at":"2026-08-06T10:32:33.650545Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.650545Z"},"links":{"cited_paper":"/paper/1909.05398","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:bdaa1f8c7b88e2ffb9454ea2f3dc506b7736fa2cef4f87b5c5bc91568a3d9aae","observation_id":"b9a2ed50-0cf9-4000-8aeb-05c722437768","resolution":{"observed_at":"2026-08-06T10:32:33.650545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-07-06T19:36:45.701678Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-06T10:32:33.654873Z","title":"Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.654873Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:b5dcd927f70edd059df9c7fb7b17a9177cbb591e107689f7d9ea27aad5642df3","observation_id":"6931e197-79b0-4ee8-955f-8f83aa2a1dbf","resolution":{"observed_at":"2026-08-06T10:32:33.654873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-06T10:32:33.662216Z","title":"David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, and Samuel R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.662216Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:bfed8e98305fde3c7b3ab1698b923219f014821684527d14485c9f82dee3a763","observation_id":"b427c8d8-807f-4f2c-8c40-6eb97c5780bf","resolution":{"observed_at":"2026-08-06T10:32:33.662216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T10:32:33.665707Z","title":"Ved Sirdeshmukh, Kaustubh Deshpande, Johannes Mols, Lifeng Jin, Ed-Yeremai Cardona, Dean Lee, Jeremy Kritz, Willow Primack, Summer Yue, and Chen Xing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.665707Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:bf5649f35025b22c1ce1e99aafded503c06a627c451a63ef41e107b514859cfc","observation_id":"d032d437-81f3-4623-9314-d492177e97ed","resolution":{"observed_at":"2026-08-06T10:32:33.665707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17399","last_updated":"2025-03-06T04:41:56Z","snapshot_observed_at":"2026-08-05T22:39:31.964846Z","submitted_at":"2025-01-29T03:29:24Z","title":"MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17399","snapshot_observed_at":"2026-08-06T10:32:33.669131Z","title":"Susan Smetale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.669131Z"},"links":{"cited_paper":"/paper/2501.17399","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:7e6403dbcd570520ee0feabf82e54b370c3f132cc19de9d97111609db7bbe2a2","observation_id":"0a513bc0-9837-42b3-8f72-4faf142f9ccd","resolution":{"observed_at":"2026-08-06T10:32:33.669131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T10:32:33.675992Z","title":"Jason Wei, Zhiqing Sun, Spencer Papay, Scott McKinney, Jeffrey Han, Isa Fulford, Hyung Won Chung, Alex Tachard Passos, William Fedus, and Amelia Glaese","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.675992Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:cc401ffb9f62c2977075d89abecc04bd61dfb2f3ccea4030a3ce5ec5c8f7e6ca","observation_id":"cf4fa4a3-6d43-4ab8-b363-b39db566f4f3","resolution":{"observed_at":"2026-08-06T10:32:33.675992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-06T10:32:33.679463Z","title":"Shunyu Yao, Rohan Rao, Matthew Hausknecht, and Karthik Narasimhan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.679463Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:0ab5180202a2b3e825f4c359819b4162325fe84390c6d716a0247f2af5625f37","observation_id":"a53f149a-7e84-4e6d-a52a-cb9a4b22006b","resolution":{"observed_at":"2026-08-06T10:32:33.679463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02903","last_updated":"2020-10-06T17:36:29Z","snapshot_observed_at":"2026-07-06T10:02:02.340983Z","submitted_at":"2020-10-06T17:36:29Z","title":"Keep CALM and Explore: Language Models for Action Generation in Text-based Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02903","snapshot_observed_at":"2026-08-06T10:32:33.682799Z","title":"Shunyu Yao, Noah Shinn, Pedram Razavi, and Karthik Narasimhan","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.682799Z"},"links":{"cited_paper":"/paper/2010.02903","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:59a36572c367aaf4ce51209566efbcf7ce67de2a223a3fe9b96ced503c0b2315","observation_id":"cf6e84a8-dbe5-4d56-bff1-3a6c33cbfc4b","resolution":{"observed_at":"2026-08-06T10:32:33.682799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-06T10:32:33.686110Z","title":"10 A T EXT QUESTS Environments A.1 Environments TEXT QUESTS consists of 25 classic Infocom games","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.686110Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:ace8af4bef973081a39bc3b92ef3e0d2863acae5996619c2044a57686c5560ca","observation_id":"d7ad646c-81c8-41ae-b2fd-771f9ec33677","resolution":{"observed_at":"2026-08-06T10:32:33.686110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:34.021926Z","title":null,"venue":null,"work_id":"eda22606-40c6-484d-be80-bf3e08c8f3d5","year":1983},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.672526Z"},"links":{"citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:4a4e67361c2a969cf4894a53e861faf9931a2895465adbc573c311ded1dbc2fb","observation_id":"936c68e0-6504-4eca-9798-42321d74d541","resolution":{"observed_at":"2026-08-06T10:32:34.025160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08837","last_updated":"2020-01-23T22:33:18Z","snapshot_observed_at":"2026-08-07T19:19:36.919209Z","submitted_at":"2020-01-23T22:33:18Z","title":"Graph Constrained Reinforcement Learning for Natural Language Action Spaces","version":1},"cited_work":{"arxiv_id":"2001.08837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.08837","snapshot_observed_at":"2026-08-06T10:32:33.924392Z","title":"Graph Constrained Reinforcement Learning for Natural Language Action Spaces","venue":"cs.LG","work_id":"a51fdf02-4eea-4562-b931-a5aeb5562f02","year":2020},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.638115Z"},"links":{"cited_paper":"/paper/2001.08837","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:874359dfa7d6b2b197e82f0d44d00453f984d3dfc44fd4c4bdfde6431521bf2e","observation_id":"9dc0c724-c700-4f6c-81ad-33c8d9d18991","resolution":{"observed_at":"2026-08-06T10:32:33.929689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-06T10:32:33.658758Z","title":"Ali Modarressi, Hanieh Deilamsalehy, Franck Dernoncourt, Trung Bui, Ryan A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.658758Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:4a9818882a318f4ac4f9b9d462fb10f1b225cc178b3a39f09a9f80ce8dee15af","observation_id":"f1e4e1fa-c232-434e-93ac-b54be87693bb","resolution":{"observed_at":"2026-08-06T10:32:33.658758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-06T10:32:33.642657Z","title":"Jun Shern Chan, Neil Chowdhury, Oliver Jaffe, James Aung, Dane Sherburn, Evan Mays, Giulio Starace, Kevin Liu, Leon Maksin, Tejal Patwardhan, Lilian Weng, and Aleksander M ˛ adry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.642657Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:c9faad6758c1b0ab5dddb0225bf547ad00c36a204a636dfdda55264c7a82431d","observation_id":"38731489-54f2-4d90-a894-9f3335f618d0","resolution":{"observed_at":"2026-08-06T10:32:33.642657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:33.633746Z","title":"Prithviraj Ammanabrolu and Matthew Hausknecht","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.633746Z"},"links":{"citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:250f78d3df3a00b078df518adcc8bea0ed471fc659ef8a90c453ac7c299cfc7c","observation_id":"1d61648b-c074-4e2d-b1ed-e04f00aabbe7","resolution":{"observed_at":"2026-08-06T10:32:33.633746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T20:33:26.749462Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 7 inbound Pith citation observations for arXiv:2507.23701."}